Tavus 发布 Griffin 数字人模型,视频通话骗过近半数测试者
美国 AI 公司 Tavus 于 10 月 1 日正式发布 Griffin,称其为全球首个“人类交互模型”(Human Interaction Model, HIM)。与传统的语音转文字、大模型回复、再合成语音的级联方案不同,Griffin 用统一的视频到视频架构同时处理声音与画面,目标是让机器在实时视频通话里像真人一样“看见、听见、回应并做出表情”。

在 Tavus 组织的真人测试中,54 名参与者与 Griffin 进行了一分钟视频通话,其中 26 人(48%)认为自己是在和真人对话,而该公司上一代系统的通过率仅有约 2%。Tavus 表示,Griffin 因此成为首个通过“实时视频图灵测试”的模型。技术层面,Griffin 由连续对话建模引擎与音视频生成引擎组成:前者以亚秒级节奏判断何时开口、倾听或做出反应,后者用自回归扩散变换器(VDiT)以 320 毫秒为单位生成 720p 视频,并能在用户说完之前就开始回应,实现点头、插话等“副语言”动作。
在英伟达 VideoFDB 评测中,Griffin-Lite 在对话行为维度拿到 3.83 分(满分 5),接近真人参考的 3.92 分,明显领先其他参赛系统。目前 Tavus 先放出 Griffin-Lite 研究预览版,仅向受信任的测试者开放,更大规模版本将随后推出,并承诺在公开前先落实披露与安全机制。

这一突破被视为消费级数字人和智能体交互的重要里程碑:导师、陪伴、客服等场景有望获得更自然的视频形象。但随之而来的风险同样突出——能以假乱真的实时视频可能被用于针对老人的诈骗或冒用他人身份。部分媒体已指出,Tavus 需明确“何时、如何”强制 AI 披露与取得肖像授权,否则类似技术放大会放大深度伪造危害。如何在“更自然”与“更可控”之间取得平衡,将是这类人类交互模型走向公众前必须回答的问题。
读者评论 (3)
想参与讨论?请 登录 后发表评论。
48%这个数据太刺眼了,感觉以后再和视频里的人寒暄,都得下意识怀疑对方是不是个代码
最烦的是还没上线就有人催着接电话,谁先被骗的算谁的
近半数人被骗,这技术太吓人,以后打视频再确认下对方是不是真人吧