和一个"人"视频聊了半天,挂断后才发现对方根本不是人。Tavus 发布的 Griffin,把这件事的发生概率拉到了 48%。
这家公司称 Griffin 是首个通过视频图灵测试的 Human Interaction Model。在它之前,同类系统的通过率低于 3%。从 3% 到 48%,中间隔的不是一点优化,是一次量级跳变。
![]()
它到底能做什么
有作者拿到早期访问权限后体验了这个视频到视频模型。它的能力清单不长,但每一条都指向"像人":边看边听,能打断对方,也会被打断,还会对房间里发生的事做出反应。
这几件事拆开看都不新鲜,合在一起才是难点。打断与被打断意味着它得判断什么时候该停、什么时候该抢;对房间内事件的反应意味着它接收的不只是对话音频,还有画面里的环境信息。
3.83 分和 3.92 分
在 NVIDIA Video Full-Duplex Benchmark 上,Griffin 的生成得分是 3.83/5,真人的得分是 3.92。两者之间只差 0.09。
这个差距放在评测里不算小,但放在"人机对话"的语境里,已经足够让近一半的对话者放弃分辨。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.