博主头像

大语言模型并非终局 | Rich Sutton | 强化学习 | 大语言模型 | 持续学习 | 合成

外来客 • 2026-08-25 18:17:00

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

🧠 核心观点:大语言模型的局限与智能本质

  • LLM并非终局:大语言模型仅展现了约四分之一的智能,其发展受限于互联网数据量的物理上限,过度依赖人类已有知识最终会阻碍发展。
  • 合成数据是错误路径:依赖合成数据被视为巨大错误。世界比任何模拟都复杂,合成数据无法涵盖真实世界的无限细节(如物理交互、电机磨损、他人思维),且生成过程受限于人类专家知识的边界。
  • 持续学习是核心:当前LLM在运行时权重不变,不属于真正的持续学习者。真正的心智应能通过与环境交互不断累积经验、更新权重,而非仅靠上下文窗口或一次性训练。
  • 摒弃“苦涩的教训”误区:不应仅关注获取静态知识,而应专注于能随算力扩展的学习算法。智能的本质是不断累积经验并适应环境,而非单纯的知识存储。

📊 关键事实与论据

  • 历史背景:Rich Sutton在2003年AI寒冬期间确诊癌症,后康复并建立强化学习学术重镇;2019年发表《苦涩的教训》,主张聚焦可扩展的学习方法(如搜索和学习)。
  • AlphaGo案例:AlphaZero证明无需人类棋谱即可获胜,印证了从经验中学习的理念,但Sutton强调这并非否定知识价值,而是指出当前系统缺乏“先学习模型再规划”的能力。
  • 灾难性遗忘:朴素地用新样本更新权重会破坏旧知识。现有方案(如批量数据更新)效率低且无法实现个性化。
  • 技术瓶颈:当前缺乏能同时学习“知识”和“如何学习”的算法。梯度下降过程缓慢,无法支持复杂度的持续增加。
  • 人类学习类比:人类通过本体感觉和视觉反馈重新学习行走,证明大脑具有极强的可塑性,能摒弃旧习并适应新环境,这是AI系统急需具备的能力。

🚀 解决方案与未来展望

  • 持续反向传播:Sutton团队提出该算法,已发表于《自然》杂志。核心包括:
  • 独立学习率:为每个权重设置独立学习率,大部分权重学习率极小,避免破坏已有知识。
  • 生成与测试机制:在不依赖梯度的情况下提出新特征或单元,直接增加网络复杂度。
  • Alberta计划:2022年提出的12步计划,其中第二步“持续深度学习”被视为解锁后续可能性的关键。
  • Oak Lab目标
  • 愿景:构建自我一致、持续进化且保持内在连贯的心智。
  • 技术指标:5-10年内打造拥有万亿参数、运行功耗仅20瓦的模型。
  • 团队策略:从小规模起步,招募认同愿景的成员,避免盲目扩大规模。
  • 多智能体架构:基于“大世界假说”,单一系统无法学习无穷无尽的事物,未来将衍生出许多不同的心智/智能体,各自从特定经验中学习。

⚖️ 共识与分歧

  • 共识:当前LLM范式存在根本缺陷,无法实现真正的持续学习和个性化;世界复杂度远超模拟环境。
  • 分歧
  • 数据源:行业主流依赖合成数据扩展,Sutton认为这是死胡同,主张直接从真实经验中学习。
  • 学习时机:主流实验室在发布后冻结模型权重,Sutton主张模型在使用中应持续更新权重。
  • 资源投入:大型实验室倾向于消耗大量能源提升性能,Sutton认为这是展现实力的方式,但也指出其路径依赖风险。

博主头像 👤 同一博主

查看该博主全部 61 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。