AI 初创公司 Tavus 表示,其新模型 Griffin 已经能在实时视频通话中让不少人误以为自己正在和真人交流。公司称,在一项直播视频通话测试里,54 名与 Griffin-Lite 对话的参与者中,有 26 人在结束后表示,他们相信通话另一端是真人,占比 48%。
Tavus 于 10 月 1 日发布这套系统,并将 Griffin 称为首个 Human Interaction Model,也就是面向面对面交流理解与生成的 AI 模型。按照 Tavus 的说法,这套模型不仅处理语言内容,也会关注表情、停顿等交流信号。相比之下,该公司上一代系统在同类测试中的得分只有 2.4%。
这次接受测试的是 Griffin-Lite。Tavus 称,它与 54 人进行了互动,其中 26 人在事后认为自己的对话对象是真人。旧系统则面对 41 人,最终只有 1 人相信对方是真人。
测试设置与结果来源
Tavus 介绍,参与者事先被告知,他们会与另一名「人」进行一场 1 分钟的视频通话,话题是「今年最期待什么」。直到通话结束后,研究人员才询问他们,通话过程中是否曾怀疑对方并不是真人。
这并不是经典的图灵测试。1950 年,英国数学家艾伦·图灵提出的图灵测试,是由评判者分别与隐藏的人类和机器交流,再判断谁是谁。而在 Tavus 这次测试中,通话双方并没有被提前告知,另一端可能是机器人。
相关结果来自 Tavus 自己的研究页面。参与者则通过该公司所称的独立研究平台招募。X 上的一则社区注释已经指出,这些结果没有经过独立验证,也没有遵循标准化协议。Tavus 还表示,那些后来起疑的人,通常会在 20 秒内产生怀疑。
与其他 AI 测试结果对照
围绕「让 AI 看起来像真人」的研究并不新鲜。加州大学圣迭戈分校的一项研究发现,OpenAI 的 GPT-4.5 在文本对话测试中,当被提示扮演一个内向、熟悉互联网的年轻人时,有 73% 的对话让评判者相信它是人类。不过,那项测试只涉及文本,不包含视频和语音。
Griffin 则把人脸和语音都加入了实时交互过程。
NVIDIA 基准测试成绩
在 NVIDIA 的 VideoFDB 基准上,Tavus 表示 Griffin-Lite 排名第一。这个基准用于测试实时音视频对话能力。
其中,generation 赛道主要评估模型回复是否自然、表达是否丰富。Tavus 称,Griffin-Lite 在这一项拿到 3.83 分,第二名系统为 2.80 分,人类参考值为 3.92 分。
perception 赛道则用于检验模型是否理解自己看到和听到的内容。Griffin-Lite 在这一项得分 3.73,最强基线模型为 3.44,人类参考值为 4.20。Tavus 表示,这项评估由 NVIDIA 独立完成。
实时交互与延迟表现
Tavus 还称,Griffin 采用 full-duplex 架构,也就是可以像电话通话那样同时听、看、说,而不是像对讲机那样轮流进行。在 Tavus 的演示中,这个模型会根据用户手中魔方的状态,指导一名男子完成还原;当对方安静下来思考时,模型也会等待。
按 Tavus 的说法,在 NVIDIA H100 芯片上,Griffin 的音频到视频平均延迟为 0.43 秒。这类芯片常用于 AI 数据中心。公司称,这一延迟水平约为次快方法的一半。
视频通话诈骗风险已是现实问题
这类技术之所以值得关注,一个直接原因是,诈骗者已经开始在视频通话场景中使用 AI。
今年 1 月,与朝鲜有关联的黑客曾在 Zoom 或 Teams 通话中使用深度伪造视频,冒充受害者信任的联系人。安全研究人员将这起入侵事件归因于 BlueNoroff,该组织是 Lazarus Group 的一个分支。受害者会被诱导安装伪装成音频修复工具的恶意软件。
在那份报告中,去中心化 AI 算力网络 Gonka 的联合创建者 David Liberman 表示,照片和视频已经不能再被当作某件事真实存在的证明。报道同时指出,当时使用的模型还没有发展到 Griffin 这样的水平。
企业防御与 Tavus 的开放范围
企业已经开始临时调整防御方式。2025 年,Kraken 曾识别出一名疑似朝鲜背景的求职者试图渗透交易所。其安全团队当时提出了一些临场问题,例如要求对方出示政府身份证件,以及说出当地餐厅名称,而这名候选人在回答时表现吃力。
Decrypt 在报道中还提到,媒体曾尝试使用 Tavus 的模型,但结果「令人失望」。进一步查询后发现,Griffin-Lite 目前并未向客户开放,只提供给部分受信测试者作为研究预览版本。Tavus 表示,公司正在开发披露功能,并与 AI 安全组织合作。
Tavus 给出的原因是,Griffin 在公开发布前仍需要配套安全措施。
融资与访问方式
Tavus 曾在 2025 年 11 月完成 4000 万美元 B 轮融资,由 CRV 领投。此前那个在测试中得分 2.4% 的系统,是由 3 个独立模型拼接而成,分别负责视觉、对话和感知。
目前,受信测试者可以通过 Tavus 官网提交表单,申请访问 Griffin-Lite。

