来客网

AI击穿了「视频图灵测试」,1700万网友在线围观

声明:本文转载自 「倍可亲」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

AI击穿了「视频图灵测试」,1700万网友在线围观

来源:倍可亲(backchina.com)

  过去,视频通话常被当成确认身份的一道保险。文字可以代写,声音可以合成,但让对方打开摄像头,聊几句、看表情,似乎总能多一分把握。

  如今,连这份眼见为实的笃定也开始受到挑战。

  最近,AI 研究团队 Tavus 发布实时视频交互模型 Griffin,并公布了一项实验结果。在与其研究预览版 Griffin-Lite 进行一分钟视频通话后,54 名参与者中有 26 人认为,屏幕另一端坐着一个真人,占比约为 48%。

  ▲ 截至发稿前,近 1736 万网友围观

  作为对照,Tavus 上一代系统在相同实验流程下,只有 41 人中的 1 人被当成真人,比例为 2.4%。

  Tavus 据此宣称,Griffin 是首个通过实时「视频图灵测试」的模型,并将其归入一个新类别 Human Interaction Model,简称 HIM,即人类交互模型。

  不过,「首次通过」目前仍是 Tavus 对实验结果的定义,同时由于尚未全面开放预览,不排除存在画饼 Demo 的嫌疑,而要具体理解这次发布,需要同时看清三个问题,参与者如何被说服,模型如何完成互动,以及一分钟的表现究竟能证明多少。

  让人相信的细节,藏在说话之外

  与 AI 聊天时,最容易让人出戏的瞬间,未必是答案有多离谱,有时只是它太不会接话。

  你停下来组织语言,它立刻抢着回答;你讲了一件难过的事,屏幕上的脸却还挂着笑;你打断它,它仍沿着原来的节奏继续说。答案可能没有错,交流却始终有些别扭。

  Griffin 尝试处理的,就是这些发生在语言之外的细节。按照 Tavus 的介绍,它能够同时看、听、说,并根据对方的表情、视线、语气和停顿,持续决定接下来该做什么。

  在官方演示中,模型展示了随对话改变情绪、语调和动作的能力,还参与了模仿指令游戏、魔方互动,以及观察用户焊接电路板等场景。Tavus 希望借此说明,模型能够结合画面和时间信息参与交流。

  比如,同样是一段沉默,有人正在思考,有人已经说完,有人则可能希望对方继续解释。系统需要结合上下文与非语言信号判断,避免把每次声音停止都当成发言结束。

  视觉生成的范围也扩大了。Tavus 称,Griffin 能从一张参考图像出发,实时生成整个画面,包括人物的脸、手臂、手指,以及椅子的移动、阴影和背景变化。

  因此,屏幕上的角色在听人说话时,也可以点头、调整视线或改变表情,不必等到自己的台词开始,才突然有了动作。

  AI 想学会聊天,得摆脱轮流答题的节奏

  上述能力背后,是交互方式的变化。

  常见的级联系统会依次完成语音识别、语言模型回答、语音合成和数字人驱动,多个环节前后衔接。用户说完一句,系统处理一句,再把结果交给下一环节。

  Griffin 采用全双工视频交互方案。所谓全双工,就是系统在输出语音和视频的同时,仍持续接收并处理用户的声音与画面。

  ▲ 左为原图,右由 AI 辅助翻译,仅供参考

  它由两个主要部分构成。

  持续对话建模引擎负责感知现场、决定说什么以及何时回应,同时输出情绪、表情和动作等控制信号;音视频生成引擎则将这些信号转化为连续的声音与画面。

  对话引擎以小于一秒的间隔重新评估交流状态,所以模型在一句话说到一半时,也能根据用户反应决定暂停、继续或让出发言机会。

  实现这种配合,还需要生成速度跟得上。

  Griffin-Lite 的语音模块采用流式生成,能够随着控制信号到来逐步输出声音,并支持利用约 10 秒参考音频克隆声音。

  视频模块则以每段 320 毫秒的方式,实时生成 720p、25 帧每秒的视频。团队通过模型蒸馏和自回归训练,将原本多步生成的过程压缩为少步生成,同时改善长时间输出时的画面稳定性。

  在 Tavus 公布的 H100 测试中,音频到达后,其效果出现在画面上的平均延迟为 0.43 秒,约为比较对象中下一快方法的一半。该数字衡量的是音频到视频的生成延迟,不能直接当成用户提问到收到完整回答的时间。‘

  画面质量方面,Griffin-Lite 在与四种已发表流式扩散模型的比较中,取得了 DOVER、FID 和 THEval 三项指标的最佳成绩;唇形同步指标 LSE-C 得分为 7.27,位列第二。

  榜单接近人类,一分钟实验仍有边界

  除了内部测试,Griffin-Lite 也出现在英伟达的 VideoFDB 公开榜单上。该基准分别评估模型能否理解交流中的非语言信号,以及能否生成符合情境的声音、表情和动作。

  生成赛道中,Griffin-Lite 的总分为 3.83,人类参考分为 3.92,排名下一位的 Gemini 2.5 与 Anam 组合为 2.80。感知赛道中,Griffin-Lite 得分 3.73,人类参考分为 4.20,最高的其他公开基线成绩为 3.44。

  两项成绩均领先榜单中的其他 AI 系统,但它们属于特定基准下的评分。尤其需要注意,部分比较对象只接收音频,部分接收音视频,输入条件存在差异,排名不能直接推广为所有能力的比较结论。

  至于最受关注的 48%,来自另一项由 Tavus 组织、通过独立研究平台招募参与者的实验。

  参与者事先被告知,将与另一名参与者视频通话一分钟,讨论今年最期待的事情。实际出现在屏幕上的,是由 Griffin-Lite 实时生成脸、声音和回应的 AI 角色。

  通话结束后,参与者先评价对方的自然程度、可信度和交流体验,直到问卷最后才被问及,是否怀疑过对方并非真人。研究结束时,所有人都被告知了 AI 身份。

  最终,26 人判断对方是真人,这组参与者对判断的平均信心为 79%;认为对方是 AI 的参与者,平均信心则为 81%。产生怀疑的人,通常在通话开始后的 20 秒内就有所察觉。

  模型也尚未消除所有交流障碍。在七分制评价中,自然程度为 5.4,可信度为 5.6,再次交流意愿为 5.8,而对话流畅程度为 4.9,是五项评价中最低的一项。

  实验说明,实时合成的面孔已经能够在特定条件下让部分人信以为真。但样本只有 54 人,通话仅持续一分钟,参与者又被提前告知对方是另一个人,结果仍需要更大规模、更长时间和更多场景的验证。

  越像真人,越需要说明自己是谁

  在 Tavus 对 Griffin 的愿景中,你永远不会去思考交流的「机制」。你不会去想「我要用什么词汇才能让他听懂」,你只是自然地表达,让对话如水般流淌。

  想象一下,未来的在线辅导,不再是冷冰冰的 PPT 录播。AI 老师能从你紧锁的眉头看出你没听懂,然后主动换一种更通俗的比喻;

  未来的客服,不需要你费尽心机描述零件的型号,你只需要把它举到摄像头前,AI 就能和你一起研究怎么修理它。

  机器终于俯下身来,走进了人类的语境里。

  这也是为什么,Tavus 在发布 Griffin-Lite 预览版的同时,宣布只向部分可信测试者开放研究预览,尚未供普通客户使用。

  团队表示,正在开发 AI 身份披露功能,并开展进一步的安全与对齐评估,更广泛的发布将取决于相关问题的处理进展。

  过去,数字人的挑战是怎样让人愿意与它交流;随着实时生成越来越自然,产品还必须回答怎样让人知道自己正在与谁交流。让 AI 学会看眼色,可能会降低使用门槛,让用户看清它的身份,则将决定这份便利能否建立在信任之上。

版权说明 / Copyright Notice:
Content and images in this article may originate from third-party sources and are used for news reporting, commentary, or public interest purposes. All copyrights remain with their respective owners. Please refer to the Copyright Notice at the bottom of this page.
本文内容仅供信息参考,不代表倍可亲立场或观点。

评论 (0)