博主头像

智能的基石与未来 | 李飞飞 | 安德鲁·休伯曼 | ImageNet | 计算机视觉 | 空间智能

外来客 • 2026-08-21 13:07:07

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

🧠 视觉与智能的进化基石

  • 视觉是智能的基石,这一观点在生物进化和人工智能两个维度得到验证。
  • 5.4亿年前,三叶虫等早期动物进化出光感受器细胞,感知光线的能力触发了寒武纪大爆发,改变了生物对自我和外部世界的认知。
  • 人类大脑中约一半的皮层活动与视觉功能有关,儿童在学会说话前首先发育成熟的是视觉能力。
  • 神经网络算法的灵感源于神经科学家修布尔和维泽尔对哺乳动物视觉皮层层级结构的研究,这种从视网膜到形状识别的层级架构是神经网络的生物学原型。

📊 ImageNet与深度学习突破

  • 2006年,李飞飞在普林斯顿大学执教期间发现数据匮乏是AI进展缓慢的核心瓶颈,发起ImageNet项目。
  • ImageNet包含超过1500万张图像,旨在让机器识别日常物体,解决了当时算法输入数据量稀少的问题。
  • 2012年,ImageNet数据集、GPU并行计算能力和成熟的神经网络算法三者融合,导致算法错误率断崖式下降。
  • 2016年,机器在识别1000种物体的任务上正式超越人类基准(人类错误率约4%),标志着现代人工智能的真正起点。
  • 2017年Transformer论文发表,凭借更强大的架构和互联网文本数据,推动了语言处理领域的重大突破,最终在2022年迎来ChatGPT时刻。

🎥 视频理解与物理常识

  • 2023年起,视频成为训练数据的一部分,2024年1月SORR发布,展示了AI生成符合物理常识视频片段的能力。
  • AI通过标记化视频并学习帧间关联,掌握了如猫跑向老鼠时的合理运动模式,这本质上是统计学力量而非对肌肉结构的真正理解。
  • 情境化推断(如根据室内环境判断猫尾巴而非狐狸)依赖于海量数据训练出的模式,而非手工设计的规则。
  • AI与人类学习的本质差异在于:人类儿童仅见过少量猫即可通过不同路径识别,而AI需要学习互联网上海量的猫图片。

🎨 创造力、情感与主体性

  • 互联网捕捉了语言、图像、视频等数字化内容,但无法捕捉毕加索构思画作时的艺术直觉或对童年故居的怀念等未数字化的认知体验。
  • AlphaGo对战李世石时的第37手棋展示了AI在特定规则下的创造力,但发明全新解法所需的创造力仍是未解之谜。
  • AI的“共情”(如说“我很抱歉”)仅是基于模式学习的文字输出,并非真正理解痛苦或具备人类的情感状态。
  • 李飞飞强调AI应增强和扩展人类能力,而非取代人类,反对技术精英以居高临下的态度剥夺公众的选择权和主体性。

🏥 医疗健康与人机协作

  • AI可重塑科学发现方法论,帮助综合跨学科知识,但需警惕数据不足时的风险。
  • 李飞飞父亲在斯坦福医院接受达芬奇机器人系统辅助的肝脏手术,失血量比普通手术少10倍,体现了人机协作的价值。
  • 由于肝脏结构复杂且个体差异大,目前数据不足以训练AI独立手术,人类医生操控机器人的深度协作优于自动化AI。
  • AI的“直觉”分为浅层(基于上下文的定制回答)和深层(基于荷尔蒙、气味等无法语言化的个人状态),后者目前机器无法获取。

🌍 空间智能与未来应用

  • 2024年初,李飞飞创立World Labs,使命是解锁空间智能,即让AI理解三维空间的深度、距离和物理规律。
  • 空间智能旨在将捕捉现实世界与捕捉人类想象中的世界相结合,通过文字或草图生成符合物理定律的三维交互世界。
  • 具身智能和机器人可分担体力劳动,如护理高龄父母、救灾、协助独居老人购物取药,缓解护理人员短缺问题。
  • 李飞飞主张K12学校应教授提示词工程,本质是教孩子如何提问和思考,反对以主体性为名拒绝学生接触AI工具。
  • 技术变革需多方利益相关者参与,建立伦理审查和法律护栏,避免由少数行业人士单方面决定未来,确保公众拥有共同设计未来的自主权。

博主头像 👤 同一博主

查看该博主全部 55 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。