先看一组来自 Rohan Paul 在 X 上的总结:
"Code volume surges by 300%, but output increases by only 30%: The AI dividend meets an awkward reality."
代码量飙升 300%,产出只增长 30%
这段话背后,是一篇 MIT 经济系和沃顿商学院联合发表的 NBER 工作论文,编号 w35275,标题直接把问题摆在桌面上:
Writing Code vs. Shipping Code
这篇论文的作者是 Mert Demirer(MIT 经济系/NBER)、Leon Musolff(沃顿/NBER)和 Liyuan Yang(MIT),2026 年 5 月以 NBER Working Paper 形式发布。
他们做了一件以前很少有人做的事:把 10 万名 GitHub 开发者的活动数据和他们使用 AI 工具的遥测数据拼在一起,用匹配事件研究法(matched event study),追踪 AI 编程工具采用前后的变化。
换句话说,AI 帮你多写了将近两倍的代码,但最后多发布出来的软件只有三成。
中间那超过一半的"额外努力",被审查、集成、测试、修复边缘情况、合并冲突和发版流程消耗掉了。
论文给这种现象起了个名字叫「弱链条假说」(weak-link hypothesis):整个链条的产出取决于最慢的那个环节。
AI 加速了写代码,但审查、QA、产品决策、部署,这些还是人在做,还是原来的速度。
论文还估算了一个关键参数:AI 产出与后续人类工作之间的替代弹性(elasticity of substitution)只有 0.25。
如果替代弹性接近 1 或大于 1,说明 AI 多干一份,人可以少干一份,两者可以互相替换。但 0.25 意味着强互补。
AI 多产出的每一行代码,背后都需要人类投入对应的审查、测试和集成工作。AI 写得越多,人类要跟进的工作反而越多。
大家以为 AI 写代码更快,团队就能更快交付。但现实是:代码产出加速后,瓶颈转移了。
从"写不出来"变成了"审不过来""测不完""合不了""发不出去"。
论文没有只停留在 GitHub 数据上,还把视角拉到了下游——四大应用商店:Apple App Store、Google Play Store、Chrome Web Store 和 SourceForge。
结果发现:自 2025 年中以来,新上架的 App 数量确实有明显增长。
但是,这些新 App 在上架后三个月内的总使用量,在四个商店里都没有增加。
AI 降低了"做一个 App"的门槛,但没有降低"做一个有人用的 App"的门槛。
市场上多了一批软件,用户却并没有因此用上更多新东西。