社員にAIを配ったあと、「使っている人ほど成果が出ているのか」を確かめたい経営者の方に向けた記事です。
AIは使えば使うほど効くのか。それとも、どこかで効きが鈍るのか。経済の言葉でいえば、収穫逓減が起きるのかどうかです。
この問いに、数万人規模のデータが続けて出ています。並べてみると、答えは「どこで測るか」で逆になっていました。
使う日数が多い週ほど、伸び方は大きくなっていた
1本目は、Microsoftが社内の数万人のエンジニアを調べたものです(arXiv、2026年7月/査読前のプレプリント。書いたのはMicrosoftの研究者)。
2026年1月から4月に、Claude CodeとCopilot CLIという、指示するとAIが自分でコードを書き進める道具を社内に配りました。使い始めた人は、使っていなかった場合の推計と比べて、仕上げて取り込まれたコードの変更(プルリクエスト)が24%多くなっていました。
面白いのはここからです。同じ人の「使った週」と「使わなかった週」を比べると、増え方はこうでした。
- 週1日使った週:+3%
- 週3日:+15%
- 週5日以上:+50%
効きは鈍るどころか、使うほど大きくなっていました。4か月の間に効果が消える様子もありませんでした。
ただし、著者自身が注意を書いています。たくさん使った週は、たまたま軽い仕事が多かった週かもしれません。数えているのは変更の件数で、その価値ではありません。
2万5,000人の給与記録では、毎日使う人も給料が変わらなかった
2本目は、シカゴ大学のAnders Humlumとコペンハーゲン大学のEmilie Vestergaardによる研究です(2026年3月/査読前)。
デンマークの11職種(会計、顧客対応、記者、マーケティング、事務、プログラマー、教員など)で、7,000の職場の2万5,000人に調査をかけ、国の給与記録と1人ずつつなぎました。
結果は静かでした。
- AIで浮いた時間は、平均で労働時間の約3%
- ChatGPTの登場から約2年たっても、給料と労働時間への影響は、あっても2%より小さい
- 毎日使う人や「1日1時間以上浮いている」と答えた人に絞っても、給料の動きは他の人と変わらなかった
こちらはチャット型のAIが中心で、データも2024年までです。1本目の、自分で作業を進めるAIとは道具の世代が違います。
伸びた分はどこへ消えたのか
作業量は伸びているのに、給料には届いていない。その間で起きていることを、2本目の研究が拾っています。
AIを使う人の85%が、浮いた時間をほかの仕事に回していました。約30%は、浮いたはずの同じ作業に、かえって時間をかけていました。休憩や早帰りに回した人は1割未満です。
つまり浮いた時間は、仕事の量に吸い込まれていました。会社が「その増えた量」に値段をつける仕組みを持っていなければ、給料にも利益にも出てきません。
もう1つ、時間とともに効きが消えた例もあります。カーネギーメロン大学の研究チームが、Cursorという道具を入れたGitHub上の806のプロジェクトを、似た条件の入れていないプロジェクトと比べました(MSR 2026、2026年4月/査読済みの国際会議論文。対象は806件と小さめ)。
- 追加されたコードの量は、導入1か月目に+281%、2か月目に+48%。3か月目以降ははっきりした差が見られなかった
- いっぽう、コードの警告は30%、複雑さは41%増えたまま残った
- 複雑さが増えたことが、その後の作業の速さを落としていた
最初の2か月の伸びが、あとから点検と手直しの重さになって返ってきた形です。Microsoftの4か月では効果は消えていなかったので、ここは結果が割れています。
収穫逓減がはっきり出たのは、やり直しの回数だった
逓減がきれいに出たのは、別の場所でした。
AIにコードを書かせ、エラーを返して直させる往復を、何回まで続けると得かを調べた研究があります(arXiv、2026年7月/査読前。安価なモデル3種で検証した短い論文)。
改善のほとんどは最初の3〜4回で出ていました。5〜7回目のあたりからは、ほぼ何も増えません。そして結果を左右したのは、モデルの違いよりも、エラーをどう返すかという手順の組み方でした。
明日からやれること3つ
- 使った日数ではなく、浮いた時間の行き先を先に決める
2.5万人の研究では、浮いた時間は黙っていると仕事の量に吸い込まれていました。「浮いた分で何をやめるか、何を始めるか」を、配る前に1つ決めておくことです。
- 量が増えたら、点検の時間も増やす
Cursorの研究では、増えた量がそのまま後の手直しになりました。AIで作る量が増えた月は、見直しの時間を先に予定に入れてください。
- AIへの「直して」は3回までにする
3回で直らなければ、4回目を頼むより、人が指示の書き方を変えたほうが早い。研究でも、効いたのはモデルより手順でした。
まとめ
- 使う量に対しては、効きは鈍っていなかった。週5日使った週は、仕上げた仕事が5割多かった(Microsoft、数万人)
- それでも2.5万人の給与記録では、毎日使う人の給料も動いていなかった(デンマーク)
- 浮いた時間の85%は、ほかの仕事に回っていた
- 逓減がはっきり出たのは、時間(2か月で伸びが消えた例)と、やり直しの回数(3〜4回で頭打ち)だった
AIの効果を「使っているかどうか」で測ると、たぶん良い数字が出ます。確かめるべきなのは、浮いた時間が最後に何に変わったかです。社内のどこでそれを測ればいいか、一緒に考えたい方はご相談ください。
出典
- Emerson Murphy-Hill, Jenna Butler, Alexandra Savelieva「Adoption and Impact of Command-Line AI Coding Agents: A Study of Microsoft's Early 2026 Rollout of Claude Code and GitHub Copilot CLI」arXiv:2607.01418(2026年7月/査読前のプレプリント。Microsoft社内の数万人のエンジニア、2026年1月から4月)
https://arxiv.org/abs/2607.01418
- Anders Humlum, Emilie Vestergaard「Still Waters, Rapid Currents: Early Labor Market Transformation under Generative AI」RFBerlin Discussion Paper 078/26(2026年3月/査読前。デンマーク11職種・7,000職場・2万5,000人の調査と国の給与記録を接続)
https://www.rfberlin.com/wp-content/uploads/2026/03/26078.pdf
- Hao He, Courtney Miller, Shyam Agarwal, Christian Kästner, Bogdan Vasilescu「Speed at the Cost of Quality: How Cursor AI Increases Short-Term Velocity and Long-Term Complexity in Open-Source Projects」MSR 2026(2026年4月/査読済みの国際会議論文。Cursorを導入した806プロジェクトと比較対象)
https://arxiv.org/abs/2511.04427
- Tobias Kiecker ほか「Is Three the Magic Number? An Empirical Evaluation of LLM-Based Repair Loops」arXiv:2607.05197(2026年7月/査読前のプレプリント)