大语言模型并非终局 | Rich Sutton | 强化学习 | 大语言模型 | 持续学习 | 合成
外来客 • 2026-08-25 18:17:00
声明:本文为对公开视频内容的摘要整理,
未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
🧠 核心观点:大语言模型的局限与智能本质
- LLM并非终局:大语言模型仅展现了约四分之一的智能,其发展受限于互联网数据量的物理上限,过度依赖人类已有知识最终会阻碍发展。
- 合成数据是错误路径:依赖合成数据被视为巨大错误。世界比任何模拟都复杂,合成数据无法涵盖真实世界的无限细节(如物理交互、电机磨损、他人思维),且生成过程受限于人类专家知识的边界。
- 持续学习是核心:当前LLM在运行时权重不变,不属于真正的持续学习者。真正的心智应能通过与环境交互不断累积经验、更新权重,而非仅靠上下文窗口或一次性训练。
- 摒弃“苦涩的教训”误区:不应仅关注获取静态知识,而应专注于能随算力扩展的学习算法。智能的本质是不断累积经验并适应环境,而非单纯的知识存储。
📊 关键事实与论据
- 历史背景:Rich Sutton在2003年AI寒冬期间确诊癌症,后康复并建立强化学习学术重镇;2019年发表《苦涩的教训》,主张聚焦可扩展的学习方法(如搜索和学习)。
- AlphaGo案例:AlphaZero证明无需人类棋谱即可获胜,印证了从经验中学习的理念,但Sutton强调这并非否定知识价值,而是指出当前系统缺乏“先学习模型再规划”的能力。
- 灾难性遗忘:朴素地用新样本更新权重会破坏旧知识。现有方案(如批量数据更新)效率低且无法实现个性化。
- 技术瓶颈:当前缺乏能同时学习“知识”和“如何学习”的算法。梯度下降过程缓慢,无法支持复杂度的持续增加。
- 人类学习类比:人类通过本体感觉和视觉反馈重新学习行走,证明大脑具有极强的可塑性,能摒弃旧习并适应新环境,这是AI系统急需具备的能力。
🚀 解决方案与未来展望
- 持续反向传播:Sutton团队提出该算法,已发表于《自然》杂志。核心包括:
- 独立学习率:为每个权重设置独立学习率,大部分权重学习率极小,避免破坏已有知识。
- 生成与测试机制:在不依赖梯度的情况下提出新特征或单元,直接增加网络复杂度。
- Alberta计划:2022年提出的12步计划,其中第二步“持续深度学习”被视为解锁后续可能性的关键。
- Oak Lab目标:
- 愿景:构建自我一致、持续进化且保持内在连贯的心智。
- 技术指标:5-10年内打造拥有万亿参数、运行功耗仅20瓦的模型。
- 团队策略:从小规模起步,招募认同愿景的成员,避免盲目扩大规模。
- 多智能体架构:基于“大世界假说”,单一系统无法学习无穷无尽的事物,未来将衍生出许多不同的心智/智能体,各自从特定经验中学习。
⚖️ 共识与分歧
- 共识:当前LLM范式存在根本缺陷,无法实现真正的持续学习和个性化;世界复杂度远超模拟环境。
- 分歧:
- 数据源:行业主流依赖合成数据扩展,Sutton认为这是死胡同,主张直接从真实经验中学习。
- 学习时机:主流实验室在发布后冻结模型权重,Sutton主张模型在使用中应持续更新权重。
- 资源投入:大型实验室倾向于消耗大量能源提升性能,Sutton认为这是展现实力的方式,但也指出其路径依赖风险。
👤 同一博主
前Uber CEO八年蛰伏欲重构工业AI | Travis Kalanick | Industria
Cerebras CS-4:性能翻倍 | WSE-3晶圆级引擎 | AI推理芯片 | 内存带宽 |
硅谷口水战,AI十年内能治愈所有疾病么?| Dario Amodei | 癌症治疗 | AI药物研发
英伟达的新护城河 | 黄仁勋 | OpenAI | 人工智能 | AI算力 | 数据中心 | GPU
Cursor推出代码托管平台Origin | GitHub | AI编程 | AI Agent |
智能的基石与未来 | 李飞飞 | 安德鲁·休伯曼 | ImageNet | 计算机视觉 | 空间智能
草台班子?! Claude的安全护栏竟然一年没开 | Anthropic 168页AI风险报告解读
AI内存十年涨五倍需求 | SK海力士崔泰源 | HBM | 内存短缺 | AI Agent | D
首个AI定制mRNA癌症疫苗,III期临床试验成功 | Moderna | 默沙东 | 黑色素瘤 |
【分享】宇树科技上市后王兴兴首次公开演讲 | WRC 2026 | 世界机器人大会 | 现场分享
🧭 类似博主
0 条评论
发表评论
请先 登录 后参与讨论。