AI与编程:谷歌DeepMind Vahrun K. Mohran访谈
外来客 • 2026-08-25 17:57:05
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:AI & Coding: Interview with Vahrun K. Mohran of Google DeepMind)
🎯 核心概述
AI 编程能力正经历从自动补全向智能体(Agent)范式的根本性转移,其驱动力源于预训练、后训练及工具使用等多条指数曲线的叠加。尽管软件领域因试错成本低而率先受益,但行业共识认为,快速编写代码仅是短期收益,长期价值核心在于模型推理能力的深化与跨场景应用。未来五年,开发者角色将演变为管理多个智能体的协调者,而 AGI 的实现预计仍需 5 至 10 年,主要瓶颈在于模型缺乏类似人类的持续学习与动态知识更新能力。
📈 技术演进与能力突破
- 指数级增长机制:AI 编程能力的提升并非单一技术突破,而是预训练、后训练、工具使用及智能体架构并发叠加的结果。实验室通过提升“计算效率”,使每 FLOP 产生的智能远超摩尔定律增速。
- 基准测试进展:在 SWE-bench 基准测试中,模型解决率从 2024 年初的 15% 提升至目前的 80% 以上。需注意部分高分源于测试用例定义模糊,但整体趋势表明模型在复杂代码任务上的连贯性显著增强。
- 多模态与长程推理:模型能力正向多模态和长程推理发展,支持浏览器操作、操作系统交互,并能在更多数据源间保持连贯性。这种能力使得旧有的手动索引文档等功能被模型自主浏览网页等更强能力取代。
- 成本与速度优化:新一代模型如 Gemini 3 Flash 在编码能力上媲美 Pro 版本,但速度更快、成本更低,旨在降低智能获取门槛,推动智能体在更广泛场景中的落地。
🛠️ 开发者工作流与角色转变
- 从编写到管理:行业正从“自动补全”向“智能体”范式转移。未来五年,典型开发者将并行管理 10 至 20 个 AI 代理,核心任务从直接编写代码转向管理智能体、调试及中期检查,以避免代理长期运行导致方向偏离。
- 决策复杂度提升:核心挑战从“如何构建”转向“构建什么”。开发者需具备产品品味以筛选高价值功能,解决用户消费瓶颈。即使所有开发者都能即时编写软件,软件开发总时长也不会大幅缩短,因为瓶颈在于需求定义与价值判断。
- 顶级开发者实践:行业标杆案例显示,顶级开发者已跳过补全和聊天阶段,直接采用智能体工作流进行“Vibe Coding”,标志着智能体已成为高效开发的标准配置。
🎓 基础能力与教育影响
- 基础能力的重要性:毕业生若不使用 AI 工具,生产力将显著低于使用者;但仅懂工具而缺乏计算机科学基础(逻辑与权衡)者,仍劣于具备扎实基础且善用工具者。基础能力是理解 AI 权衡的关键。
- 隐性权衡的判断:AI 在缺乏完整上下文时会做出不合理取舍。开发者需具备判断能力以优化这些隐性权衡,而非盲目依赖自动代码生成。理解底层逻辑有助于在 AI 输出偏离预期时进行有效干预。
- 隐性知识转化:模型难以获取“茶水间对话”等非结构化隐性知识,导致在特定组织语境下表现受限。高价值场景下,组织需投入人力将隐性知识转化为机器可读格式,以优化智能体在特定业务逻辑中的表现。
📊 评估体系与可重复性
- 评估(Eval)的核心地位:评估是核心改进手段。团队持有大量高难度内部测试集,通过重放用户轨迹验证新代理版本是否更符合用户意图。
- 可重复性的定义:鉴于模型随机性,无法保证完全重复。可重复性被定义为行为一致性,通过大规模样本统计关键负面案例率和平均分,可验证代理行为的稳定性。
- 内部测试优势:团队深度参与基础模型研发,贡献于 Gemini 3 Pro 及 Flash 的训练。这种深度参与使得内部测试集能更精准地反映模型在真实复杂场景下的表现,而非仅依赖公开基准。
🌍 领域差异与 AGI 瓶颈
- 软件与硬科学的差异:软件领域因试错成本低,AI 增益显著;硬科学领域因实验周期长、成本高,AI 辅助价值释放将滞后于“比特世界”。硬科学需要长迭代周期,AI 难以通过低成本暴力试错弥补直觉不足。
- 持续学习缺失:当前模型缺乏类似人类的“持续学习”能力,无法在交互中动态更新内部价值函数或权重。这是通往 AGI 的关键瓶颈,也是模型无法像人类科学家那样通过连续推理解决根本性难题的主要原因。
- AGI 时间预期:AGI 的实现预计还需 5 至 10 年。主要障碍在于模型能否突破静态知识限制,实现真正的动态适应与深度提问能力。
🤝 产品策略与协作模式
- 通用智能路线:不同于部分厂商牺牲非编码能力以专精代码,Google 追求跨领域均衡的通用助手。多模态理解(如图像)被视为浏览器自动化等核心能力的基础。
- 最大化展示模型能力:产品设计原则是最大化展示模型能力。随着模型进化,产品功能应随之迭代,利用模型自主浏览网页等更强能力取代旧有功能。
- 组织协作模式:未来协作模式将取决于组织是否愿意为智能体构建高质量上下文。高价值场景下,组织需投入资源优化智能体表现,将隐性知识显性化,以释放 AI 在复杂业务逻辑中的潜力。
💡 结论与展望
- 短期与长期价值:快速编写软件只是短期收益,并非长期价值核心。未来优势将体现在更深层的推理与问题解决能力上,以及 AI 在代码库之外多场景应用中的突破。
- 技术方向信心:当前技术方向获得高度信心,Gemini 被寄予推动推理能力发展的期望。团队通过提升计算效率和优化后训练阶段,持续推动模型在连贯性和复杂任务处理上的进步。
- 最终目标:实现真正的动态适应与深度提问能力,突破静态知识限制,是未来 5 至 10 年的核心目标。这要求模型不仅能执行任务,还能在交互中动态更新知识,从而在硬科学等长迭代周期领域发挥更大价值。
0 条评论
发表评论
请先 登录 后参与讨论。