AIで速くなった気がするのはなぜか — 体感と実測がズレる理由
この章の目次開く
前の章で見たのは「どれだけの人が使っていると答えたか」でした。次に来る問いは当然これです。実際に、速くなっているのか。
素直な問いに見えますが、答えるのは驚くほど難しく、いま公開されている最も厳密な研究は直感と逆の結果を出しています。そしてその研究には続報があり、続報のほうがさらに示唆に富みます。
学習者体感では明らかに速くなってるんだけど、これって測るまでもないんじゃない?
体感と実測が逆を向いた研究
AI評価を行う研究組織のMETRが2025年7月に公開した研究は、この領域で数少ないランダム化比較試験です。
| 項目 | 内容 |
|---|---|
| 対象 | 経験豊富なオープンソース開発者16人 |
| タスク | 自分がよく知る成熟したリポジトリでの実作業246件 |
| 方法 | タスクごとに「AI利用可」「AI利用不可」をランダムに割り当て |
| 期間 | 2025年2月〜6月 |
自分の慣れたコードベースで、実際の作業を、条件だけランダムに変えて測る。かなり丁寧な設計です。
そして結果が、次の3つの数字です。
| いつ | 何を答えたか | 値 |
|---|---|---|
| 開始前の予測 | どれくらい速くなると思うか | 24%速くなる |
| 作業後の体感 | どれくらい速くなったと感じたか | 20%速くなった |
| 実際の計測 | 実際にどうだったか | 19%遅くなった |

なぜ体感がズレるのか
この食い違いには、もっともらしい説明がいくつもあります。
待ち時間が作業時間として意識されにくい。 エージェントが考えている間は自分の手が動いていないので、「作業した時間」の感覚から抜け落ちます。
出てくる速さと、終わる速さは別。 大量のコードが数秒で出てくる体験は強烈ですが、それを読み、直し、通すまでが本来の所要時間です。
やり直しが記憶に残りにくい。 うまくいった場面は印象に残り、捨てた出力や修正の往復は記憶に残りにくい。
いずれも仮説ですが、体感が信頼できる指標ではないという点だけは、この研究の設計から直接言えます。
ただし、この研究には続報がある
ここが重要です。この「19%」という数字は非常に有名になり、いまも単独で引用されます。しかしMETR自身が2026年2月に見直しを公表しています。
先生自分たちの有名な結果に対して、著者自身が「この設計は信頼できない」と公表した。研究としてはとても誠実な態度だよ。引用する側も、そこまで追う必要がある。
この話から持ち帰るもの
結論を先に言うと、「AIは遅くする」でも「AIは速くする」でもありません。
持ち帰るべきなのは、もっと地味で、もっと実務的な事実です。
AIの効果は測るのが難しく、体感はその代わりになりません。この事実は、導入を判断する立場にいるなら重く効きます。「みんな速くなったと言っている」は、速くなった証拠になりません。上で見たとおり、当人が20%速くなったと感じている状況で実測が19%遅い、ということが実際に起きています。
では何を測るか
体感が使えないなら、何を見るのか。誤導しやすい指標と、実態に近い指標を並べます。
| 測りやすいが誤導する | 測りにくいが実態に近い |
|---|---|
| 生成されたコードの行数 | 変更が本番に届くまでの時間 |
| PRの作成数 | PRがレビュー待ちで滞留している時間 |
| ツールの利用率 | 手戻り・やり直しの発生率 |
| 体感の生産性 | 品質のばらつきと、それを直すコスト |

左側は測るのが簡単で、しかもAIを導入すると確実に増えます。だから「効果が出た」という報告に使いやすい。ですがレビューの章で扱うとおり、書く速度だけが上がって確かめる速度が変わらなければ、全体の速度は変わりません。左側の指標は、その目減りを見えなくします。
「効くのか」ではなく「どういう条件で効くのか」
もう1つ、問いの立て方そのものを変える視点があります。
DORAの2025年の調査が示した中心的な発見は、AIは増幅器であるというものでした。うまく回っているチームはさらに効率的になり、苦しんでいるチームは既存の問題が増幅される。
これが正しいなら、「AIは効果があるのか」という問いは、形として答えが出ません。チームによって符号が変わるからです。平均を取れば、効果があったチームとなかったチームが打ち消し合います。
正しい問いはこうなります。どういう条件のときに効くのか。本書の残りは、実質的にこの問いへの答えです。実行環境を整え、権限の境界を引き、コンテキストを設計し、検証を自動化する——効く条件を作る作業です。
よくあるハマりどころ
体感を根拠に導入の成否を判断する。 本章の主題です。当人の実感は、方向すら合っていないことがあります。
「19%遅くなる」を確定した事実として引用する。 続報まで追うと、そう言い切れる状態ではありません。
逆に「実は速くなると分かった」と読む。 これも言えません。信頼区間はゼロをまたいでいます。
生成量で効果を測る。 確実に増えますが、成果とは別です。
平均だけを見る。 増幅器という見方が正しいなら、平均は最も情報量の少ない数字です。
ちゃんと使うためのポイント
- 唯一のランダム化比較試験では、予測+24%・体感+20%に対して実測-19%という食い違いが出た
- ただし著者自身が続報で実験デザインの見直しを公表している。単独引用は不正確
- 言えるのは「遅くする」でも「速くする」でもなく、測るのが難しいということ
- 体感は指標にならない。導入の成否を実感で判断しない
- 測るなら、生成量ではなく届くまでの時間・滞留時間・手戻り率
- 問いを「効くのか」から「どういう条件で効くのか」に変える
ここまでで前提が揃いました。次の部からは、その「効く条件」を実際に作っていきます。最初は、エージェントをどこで動かすかという話です。
参考リンク
- Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity(METR, 2025-07-10) — 実験の設計と、予測・体感・実測の食い違い
- We are Changing our Developer Productivity Experiment Design(METR, 2026-02-24) — 続報。選択バイアスと、著者自身による評価
- Announcing the 2025 DORA Report(2025-09-24) — AIを増幅器と位置づける調査結果