Griffin模型如何让AI对话像真人?

2026-10-04 18:20 来源:极客指南

  Tavus 在2026年10月初发布的实时视频对话模型 Griffin,以“48%对话者误认其为真人”成为业界首个宣称通过“实时视频图灵测试”的全双工人机交互模型(HIM),它想证明的核心命题是:AI与人的对话,可以从“轮流说话”进化到“像真人一样边听边看边回应”。

  一、量化证明:从“答题机器”到“真人替身”的跨越

  首个视频图灵测试通过者:Griffin 采用端到端 video-to-video 全双工系统,内部真人盲测中,54位受试者进行1分钟实时视频对话,48%误认为对面是真人,前代同类系统通过率普遍低于3%。

  基准测试登顶:在 NVIDIA VideoFDB(全双工 AI 视频基准)中综合得分3.83/5排名第一,真人参考基线为3.92,此前公开最优基线仅2.80。

  新品类定义:Griffin 被称为“首个人类交互模型(HIM)”,区别于传统聊天机器人,其核心是“交互”而非“应答”。

  二、技术支撑:全双工交互的三个关键能力

  同步感知:可以一边说话一边监听、观察用户表情、停顿与手势,支持被用户打断也能主动插话,同步生成人脸表情、肢体动作与语音对话。

  视觉融入对话:展示物品时能无缝写入正在进行的对话剧情,实现“看到什么就能聊什么”,视觉输入实时参与话轮构建。

  等待与节奏感:当用户沉默思考时,Griffin 能够安静等待,而不是急于填补空白,这种“节奏感”是拟真人感的关键细节。

  三、范式意义:交互模型 Griffin 想证明的终极命题

  超越“响应”走向“共情”:Griffin 展示的不只是“听懂指令”,而是通过声音、表情、姿态同步传递情绪,例如为用户升职表达喜悦时,无需声音即可从表情看出态度。

  从“工具”到“同伴”:官方愿景是让使用机器像与朋友或同事交谈一样简单,例如能注意到学生困惑的AI教师、倾听的养老陪伴者。

  定义下一代交互标准:Griffin 的成功意味着“类人交互”从文本图灵测试走向“视频+全双工”的新阶段,为AI拟真设立了可量化的新标尺。