Tavus 10 月 1 日上线 Griffin 模型:48% 真人测试者未能分辨 AI 生成视频,数字人逼近视频图灵测试
一场 1 分钟的视频闲聊,26 个人没发现自己对面坐的是 AI。
2026 年 10 月 1 日,旧金山的 AI 视频公司 Tavus 发布了 Griffin,把它定义为全球第一个「人类交互模型」(Human Interaction Model,HIM)。发布页面由联合创始人兼 CEO Hassaan Raza 与研究负责人 Ioannis Patras 署名,核心宣称是一句话:在一项真人实测中,48% 的参与者在与 Griffin 通话后认为自己在跟真人说话;而包括 Tavus 自家上一代对话视频界面在内的已有系统,通过率最高只有 2%。
2% 到 48%,这是一个代际级的跳变。但同时期的 Griffin-Lite 只是个研究预览版,Tavus 明确表示暂不向客户开放,理由是它太像真人。发布了一款分数漂亮、自己却不敢卖的模型——这件事本身就值得拆开看。
需要先划清一条线:48% 这个数字来自 Tavus 自己组织的实验,不是第三方验证的结论。下文会把它的方法学缺口逐个列出来。
一、54 个人、1 分钟、26 票
实验设计并不复杂。参与者从一个独立的研究平台招募,来自美国和欧洲,事前只知道要和「另一位参与者」进行 1 分钟的视频通话,聊的话题是新的一年最期待什么。通话结束后先填一组主观评价,问卷最后一题才问:刚才有没有想过对方可能不是真人。
结果是 54 人中有 26 人认为对方是真人,占比 48%。对照组的口径来自 Tavus 上一代系统(由 Phoenix-4.5、Sparrow-2、Raven-1 三级联模型构成),同样流程下 41 人中只有 1 人上当,约 2.4%。Tavus 官方页面把上一代的通过率概括为「最高 2%」,媒体转载的具体数字是 2.4%,两个口径指的是同一件事。
主观评价部分提供了另一层信息:认为对方是真人的参与者,平均确信度 79%;认为对方是 AI 的,平均确信度 81%。在 7 分制下,参与者给它的自然度打 5.4 分、可信度 5.6 分、愿意再聊一次的意愿 5.8 分。Tavus 还提到,察觉到异样的参与者大多在前 20 秒内就起了疑心——也就是说,骗过的人是全程没起疑,没骗过的人很快就发现了。
另一组数字来自第三方基准。NVIDIA 研究团队于今年 5 月发布的 VideoFDB,是业内首个针对全双工音视频对话的基准,素材取自真实视频通话中的 237 段双人对话片段,覆盖视线回避、停顿、附和、话轮转换等 11 类非语言场景,由大语言模型按公开打分规则评审、NVIDIA 统一打分。Griffin-Lite 在生成赛道拿 3.83 分(满分 5),人类参考值 3.92,第二名是 Gemini 2.5 配 Anam 数字人的级联方案、2.80 分;感知赛道 3.73 分,人类参考值 4.20,MiniCPM-o 4.5 为 3.40 分,OpenAI 的 gpt-realtime 与 Gemini 3.1 Flash Live 分别为 2.75 和 2.84 分。
这条第三方数据的分量,比 48% 更重。
二、方法学上,有三个洞
但这份「图灵测试」的设计里有三处必须说清楚的缺口。
第一,样本量。54 人、单次 1 分钟,这在统计上是个很小的样本。一次视频通话里让人出戏的往往是更长时段才暴露的细节——比如重复动作、反应时间过于规律、背景光影在长对话中的漂移。1 分钟足够骗过初见,不够验证持续交互。
第二,缺对照组。这项研究没有设置一个「与真人通话」的盲测对照组。换句话说,我们只知道 48% 的人把它认成了真人,却不知道同一批人在同样流程下会把多少真人认成 AI。缺了这个分母,「48%」无法被解释为一个通过率。
第三,执行方。研究完全由 Tavus 自行开展,招募平台虽然是独立的,但实验设计、数据采集与结果发布都在同一家公司手里。Tavus 的用词是「通过实时视频图灵测试」,这是公司自己的定义,不是一个被学界公认的门槛。
相比之下,VideoFDB 的评分方是 NVIDIA,这一点有本质区别。即便是这条第三方数据,也要补一句:需要注意的分寸是:在一个五级制、由大语言模型评审的量表上 0.09 分的差距,只能读作「接近人类」,读作「等同人类」是过度解读。分项数据更能说明问题——Griffin-Lite 在「双人情感呼应」上拿 4.40 分,甚至高于人类的 4.14 分;但「非语言线索恰当性」只有 2.83 分,低于人类的 3.18 分。差距主要落在响应速度上:Griffin-Lite 的中位响应时间是 1892 毫秒,而人类反应大约在 900 毫秒。

三、难点不是脸,是节奏
Griffin 真正想解决的,是不在场的那半秒。
现有实时语音 AI 多半是级联流水线:语音识别转文字、语言模型作答、语音合成念稿、形象模型对唇形。每一次接力都加一层延迟,还会丢掉下一环看不到的信息——比如语气,比如镜头里发生了什么。结果就是用户反过来迁就机器:刻意不留冷场、把话说完整、降低预期。
Griffin 改成端到端:连续对话建模引擎同时接收音视频,以不足 1 秒的「微轮次」持续评估状态,决定这一刻该开口、该附和一句「嗯哼」、该点头,还是闭嘴。它对视觉输入的处理体现在官方演示里——陪对方玩「西蒙说」时只在听到口令时才做动作,对方省略口令就当场点破;指导用户复原魔方时盯着对方的手,对方停下来思考它就安静等着;用户中途举起一个孔雀玩偶,它把孔雀写进了正在讲的故事里。
生成侧同样重构了。语音走自研的 Tavec 卷积自编码器,把 48kHz 音频压缩成每帧 40 个数值、每秒 100 帧的连续表示,不使用离散码本,最小支持 10 毫秒的数据包——一句话还没生成完就可以开始播放。约 10 秒参考音频即可克隆一个人的声音。视频侧把一个双向多步扩散模型蒸馏成少步自回归生成器,只用一张参考照片就能输出 720p、25 帧的画面,每 8 帧(320 毫秒)为一个潜在表示,扩散 3 步即可出帧;为了防止长程失真漂移,训练分三阶段:分布匹配蒸馏、教师强制、自强制。
在 NVIDIA H100 上,从音频输入到画面呈现的平均延迟是 0.43 秒,约为公开对比中最快方案的一半。值得强调的是,它生成的不是一张脸,而是整个画面——人物坐着的那把椅子的晃动、地面阴影、背景变化,全都在渲染范围内。
四、卖家该关心的:规模化一对一
Tavus 在实时方向上发力之前,做的正是跨境卖家熟悉的生意:销售人员录一段基础视频,系统自动替换客户姓名、公司等信息,批量生成一对一的推销视频。Meta 和 Salesforce 都曾用它给企业客户群发产品演示。这条路在 2020 年由 Hassaan Raza 与 Quinn Favret 创立,孵化自 Y Combinator;2024 年 3 月完成由 Scale Venture Partners 领投的 1800 万美元 A 轮,2025 年 11 月完成由 CRV 领投、红杉资本与 Y Combinator 等跟投的 4000 万美元 B 轮,累计融资约 7000 万美元。
Griffin 把这条路的价值推进了一层:从「能看」到「难辨」,直接影响的是规模化个性化触达的上限。对跨境卖家来说,可以按买家名称、所属市场、所处阶段批量生成一对一视频——比如针对弃单客户的挽回视频、针对高价值客户的季度回顾、针对不同市场的本地化问候。这类素材在传统流程里几乎不可能做,因为边际成本是线性的人力。
不过眼下有个硬约束:Griffin-Lite 是发给少数受信任测试者的研究预览,不在 Tavus 的商业平台上,也不对该平台上已有的 15 万名以上开发者和企业用户开放,客户名单里有 Amazon、Mayo Clinic 和 Salesforce。完整版的 Griffin 要等安全评估做完,Tavus 没有公布时间表和定价。也就是说,这个能力的商业化路径目前是断开的——能做的是拿现有 A/B 方案跑通话术与个性化变量的组合,等开放时直接迁移。

五、合规先行:可标注、可追溯
Tavus 把模型扣住不卖,给出的理由很直接:正是那些让它表现得像真人的交互特质,会让人误以为自己在与人交谈。这是一个在现实里有对应的风险——近年来 AI 换脸与拟声已被大量用于诈骗,而「眼见为实」是多数人的最后一道心理防线。
监管已经压上来了。欧盟《人工智能法案》第 50 条自 2026 年 8 月 2 日起适用,第 1 款规定:凡是设计与自然人直接交互的 AI 系统,提供者必须确保该自然人被告知自己在与 AI 交互,除非对一个信息充分、善于观察且审慎的人来说这是显而易见的。同条第 2 款要求生成式系统的输出以机器可读格式标记、可被检测为人工生成或篡改。配套的《AI 生成内容透明度实践准则》到 2026 年 7 月底已有约 190 家机构签署;另据 2026 年 5 月达成的 AI Omnibus 临时协议,在该条款适用日之前已上市的生成式 AI 系统,其机器可读标注义务可延后至 2026 年 12 月 2 日履行。
东南亚同样在收紧。越南第十五届国会于 2025 年 12 月 10 日通过《人工智能法》,2026 年 3 月 1 日生效,第 11 条第 4 款明确:对用于模拟真人外貌、声音或再现真实事件的 AI 生成音视频,部署方必须加贴易于识别的标识。此前自 2026 年 1 月 1 日生效的《数字技术产业法》第 44 条已要求直接与人类交互的 AI 系统告知用户其 AI 身份。
于是可行的用法是一条边界清晰的路径:把数字人素材集中在可标注、可追溯的场景——客服答疑、产品说明、售后教学、内部培训——而在需要建立品牌信任锚点的场景(创始人出镜、工厂实拍、买家真实反馈)保留真人素材。同时建立素材来源台账,记录每条素材的生成模型、生成时间、投放市场、标注方式,并核对投放平台自身的 AI 披露规则。Tavus 表示正在开发「安全披露」(强制身份告知)功能并与 AI 安全组织合作,但尚无时间表。
所以,48% 并不意味着数字人已经通过了图灵测试,它意味着「难辨」这件事第一次有了可复现的量化方法。真正的考验是:当监管部门要求每一次交互都必须自报家门,这项能力还能剩下多少商业价值?

六、参考资料
- Tavus:《Griffin: The First Human Interaction Model》
- 网易 / DeepTech 深科技:《首个通过「视频图灵测试」的模型来了?视频通话 1 分钟,近半数人没认出它是 AI》
- RuntimeWire:《Tavus says Griffin fooled 48% of testers in one-minute video calls》
- Complete AI Training:《Tavus introduces Griffin, a model it says passes the video Turing test》
- 欧盟委员会数字战略官网:《Guidelines on transparency obligations for providers and deployers of certain AI systems》
- 越南人民报网:《推动〈人工智能法〉落到实处:构建全面的人工智能治理框架》