网易首页 > 网易号 > 正文 申请入驻

ZPedia|视频版 GPT-Live 来了,形界智能发布 Genesis-1.0,面向长时、智能的 AI 互动娱乐基础设施

0
分享至



今年 7 月,OpenAI 发布 GPT-Live。相比过去一问一答式的语音助手,其核心突破不仅在于更自然的拟真音色,更在于把 AI 的交互方式从“回合制”推向了真正的实时对话:模型具备边说边听的全双工能力,支持随时打断,甚至懂得在恰当的时机保持沉默;遇到复杂推理和工具调用时,再把任务交给后台模型处理,而不需要让当前对话停下来。OpenAI 当时披露,每周已经有超过 1.5 亿人通过 Voice、Dictation 等语音功能和 ChatGPT 交互。

这件事带来的一个直观变化是,人开始更愿意和 AI 进行更长时间、更高频率的持续互动。

文字聊天天然是一种“输入—回答”的离散交互,语音则更接近现实中的持续交流。而当交互形式继续从 Voice 走向 Video,问题会再往前一步:AI 不仅要一直听着,还要一直“看着”。

用户正在说话还是已经停下来,脸上的表情是什么,突然挥了挥手还是比了一个心,甚至一句话都没有说,只是移开视线——这些没有进入文字和语音的信息,本身就是人与人交流的一部分。

9 月 18 日,成立不到四个月的形界智能(Frame-X)计划正式发布 Genesis-1.0,并向用户开放体验 24 小时 AI 直播。形界把它定位为一套面向 AI 社交、陪伴和互动娱乐的视频双工模型。

相比今年 7 月在 WAIC 首次亮相的 Genesis,1.0 版本给出了一组更接近产品化的数字:连续生成超过 24 小时,画面行为响应平均 1.5 秒,最快可达到 1.2 秒,支持全身动作,调用价格为每秒 0.003 美元。

放到今天的实时 Avatar 市场里,这组参数已经颇具进攻性。Runway Characters 的 API 单次会话最长为 5 分钟;HeyGen LiveAvatar 根据不同产品层级,单次会话上限从 5 分钟到 60 分钟不等;另一家实时视频公司 Vivix 推出的 A1,则把能力进一步扩展到全身动作与开放世界交互,并持续响应新的用户输入。


图片来源:Frame-X

但 24 小时、1.5 秒这些数字并不是 Genesis-1.0 真正想讲的故事。

形界把一个面向社交的 AI 角色需要具备的基本能力归结成两件事:它能不能一直在,以及它是不是真的看得到你。前者要求模型长期维持一个稳定的角色和世界;后一个问题则更接近真实社交的本质——AI 不仅要听懂用户说了什么,还要持续读取人的表情、动作、姿态乃至沉默,把这些非语言信号一并纳入交互。只有做到这一步,视频才不只是给用户看的输出,而真正成为模型类人感行为输出的另一条通道。


长时一致性大考:24 小时不宕机背后的“世界维持”能力

今天绝大多数 AI 视频仍然是一种有终点的内容。

用户输入一句提示词,模型生成几秒或者几十秒的视频,任务就结束了。但实时交互视频没有天然的终点,它更像一场不会提前写好剧本的直播,用户可能随时改变动作、说一句话、拿起一个物体,甚至突然离开镜头。视频必须根据已经发生的一切实时演算继续向前生成。

这也带来了实时视频最棘手的问题之一——误差累积。

实时视频生成采用 Auto-Regressive(AR)方式连续生成,模型刚刚生成的结果很快会成为下一轮生成的上下文。一次很小的偏差,如果没有被纠正,就可能不断传下去:先是人物五官稍微变化,接着衣服颜色漂移、物体消失、空间结构变形,最后连人物和环境之间原本成立的关系都逐渐失真。

所以,当生成时间从几十秒拉长到几十分钟甚至数小时,真正关键的问题在于画面的一致性——生成到足够久以后,模型还知不知道这个世界现在的确切状态。

Genesis-1.0 此次针对长时误差累积与生成一致性问题进行了专项优化,将业界约 5 分钟级的互动时长,提升至稳定的 24 小时。


图片来源:Frame-X

但 24 小时本身并不是重点。它更像一次压力测试,测试模型在经过成千上万轮连续生成之后,角色身份、场景结构和已经发生过的状态变化能否继续被模型正确继承。

这和大语言模型的长上下文能力有些相似。长上下文的关键并不是简单“读得更长”,而是在经历大量历史以后,仍然知道哪些信息和当前有关。放到视频里,就是运行足够久之后,模型仍要知道谁是谁、东西在哪里、此前发生过什么,以及下一刻有哪些状态要保持连续。

如何解决这一问题,行业正在出现不同的技术路线。

一种典型思路是 3D / Spatial 路线:在视频之外显式保存空间结构、物体状态和历史记忆。世界的结构由一套结构化状态负责维护,而视频模型更像一个翻译器,负责把它渲染成画面。对于游戏、仿真等要求精确空间关系的场景,这是一条非常自然的技术路线。

但形界押注的是另一种选择:让视频模型自己学习和维护世界状态。

它希望人物身份、空间关系和历史变化直接沉淀在模型学习到的视频表征中,而不是随着世界越来越复杂,在模型之外同步增加一套越来越庞大的状态系统。

这背后是一种更彻底的 Scaling 假设:如果世界的结构、状态和变化规律本身可以被视频模型学习,那么随着模型规模、数据规模和训练规模增加,模型能够在同一种表征中不断吸收更复杂的世界知识。相比之下,一旦把大量状态显式放在模型之外,世界复杂度上升时,外部结构化表示也需要同步变得更加复杂。

换句话说,形界希望把“记住世界”也逐渐变成模型能力本身,而不是长期依靠模型之外的一套工程系统兜底。

这当然还不是一场已经有定论的路线之争。显式 3D 状态在许多场景中有不可替代的确定性优势,而一次 24 小时实验也不足以证明视频表征能够解决所有长期记忆问题。

但 Genesis-1.0 至少把这个原本偏研究的问题向前推进了一步:互动视频开始从“不断生成下一段内容”,走向“持续维护一个正在运行的状态”。更值得注意的是它的迭代速度:从今年 7 月 Genesis 在 WAIC 首次公开亮相,到 Genesis-1.0 把连续生成推到 7x24 小时,中间只隔了两个月。


告别“套皮数字人”,端到端行为推理创造真正的“类人感”

不过,对于 Genesis-1.0 来说,长时稳定只是一层地基。如果一个角色能够在屏幕里稳定存在 24 小时,却对屏幕外用户的举动毫无察觉,它仍然只是一张无限延长的动态壁纸。

过去几年,数字人在“长得像人”这件事上经历了飞速的技术迭代。脸、口型、声音乃至微表情越来越逼真,但真正交流几十秒之后,另一种“不像人”的割裂感往往很快出现:它不知道你还没说完,不知道什么时候应该看着你,更不知道你一个没有说出口的动作究竟意味着什么。

因为真正的人际交流从来不限于单纯的语言。

人在对话中会不断观察对方的状态,再决定自己应该倾听、等待、回应还是主动表达;自己的行为又会成为对方下一轮判断的输入。社交本身就是一个持续运行的反馈回路。

这也是 Genesis-1.0 想强调的“类人交互”体验。

视频来源:Frame-X

这些动作本身并不难生成,真正困难的是:用户并没有先告诉模型“接下来请挥手”——行为是由交互本身触发的。

一个更纯粹的测试场景:用户把手放到摄像头前做出数字手势,然后问角色“这个加起来等于多少”。

视频来源:Frame-X

这时候,问题已经不再是简单的动作跟随:模型不仅需要准确感知摄像头里发生了什么,还要结合交互历史,把视觉和语言信息联系起来,再决定下一刻应该给出什么反馈。

形界把这种能力称为“端到端行为推理”。这里的“推理”不必简单等同于大语言模型内部的思维链。更值得关注的是它对应的产品能力:实时视频模型开始从“被动按照指令生成动作”,走向“根据当前场景主动选择行为”。

这和今年 GPT-Live 给语音交互带来的体验颠覆非常相似。

GPT-Live 的自然感并不只来自声音本身,更来自一些行为细节:用户插话时,它能停下来;合适的时候会用很短的回应告诉用户“我还在听”。正是这些看似细小的行为反馈,决定了一段交流是不是像真正的人类对话。

视频模态则把这种要求进一步放大了。

一个真实的人不仅会通过声音表现“我在听”,还会用视线、表情、身体姿态和动作来表达自己的状态。也因此,视频双工面对的并不是一个简单的“语音助手加数字人外壳”问题,而要考虑如何把整套非语言互动也交给模型处理。

8 月,形界与中国科学技术大学等机构联合提出 SemComp-Bench。和传统视频 benchmark 关注画质、运动质量不同,它专门评价模型有没有真正完成用户要求的语义任务,并提出 Outcome Achievement 和 Generation Reliability 两类指标。

当视频只是一种内容时,最重要的问题是“生成得好不好看”;但当视频变成实时互动方式以后,评价标准会多出更关键的一层:它有没有理解你,以及它有没有做出正确的行为。

所以 Genesis-1.0 想建立的“类人感”,不只是一个看起来更逼真的 Avatar,更是一个能够完成倾听、思考、反馈、表达完整交互反应闭环的智能体。


1.5 秒背后,AI 的“反应”和“思考”开始被拆开

类人感还有一个很现实的前提:速度。

你向一个人挥手,对方 4 秒以后才慢慢挥回来,动作即使完全正确,交流仍然会显得怪异。真实社交里的自然感很大程度上来自 timing——什么时候回应,什么时候等待,什么时候保持一个倾听中的表情。

形界此前发布沉浸式视频模型 Rise 时,公开展示过最低 500 毫秒级的端到端交互延迟。其背后的技术主张,是把视频输入、行为理解和画面生成拉进同一个连续时序中,尽量减少独立理解模型与生成模型之间的串行传递。

Genesis-1.0 延续了这条思路。但进入社交场景以后,它还需要处理另一个矛盾:有些反馈必须立刻发生,有些任务却需要更长的计算时间。Genesis-1.0 此次给出的画面行为平均响应时间是 1.5 秒。模型本身会持续感知用户输入,并即时生成角色的动作、表情和画面,维持低延迟感知和生成的闭环;Genesis-1.0-Brain 则负责问答内容、语言风格、MCP 工具调用等更高层的异步规划。


图片来源:Frame-X

这里的核心并不是简单把所有任务都压缩到 1.5 秒以内,而是让“反应”和“思考”运行在两个不同的时间尺度上。当用户抬手打招呼时,角色不应该等一个复杂的大模型完成数秒推理以后才做出动作;但当用户要求它回答复杂问题、调用工具或者完成某项任务时,系统又必须允许更深的推理发生。

如果所有能力被串在一条链路里,任务越复杂,模型越聪明,交互就可能越慢。更合理的方式,是让即时感知和行为生成保持高速运转,同时把需要更多计算时间的智能任务放到另一层异步完成。

有意思的是,GPT-Live 在系统设计上采用了类似的分层思路。OpenAI 的全双工语音模型负责维持实时交流,需要复杂推理或工具使用时,再异步委托后台模型处理,而当前语音流不必因此中断。

但“视频版 GPT-Live”这个说法并不是说 Genesis 与 GPT-Live 使用了相同的技术架构,而是两者都在处理实时 AI 的共同矛盾点:人要求即时反馈,但智能本身需要时间。实时交互时代的产品需要一种新的能力——即使 AI 还在“想”,它也不能在关系层面消失。

视频来源:Frame-X

对于声音,这意味着倾听、停顿和简短回应;对于视频,则意味着眼神、表情、身体动作,以及始终保持“在场”的状态。

这可能比单纯把延迟从 2 秒压到 1 秒更重要。


从文件到软件,视频会成为下一代人与 AI 的交互界面

传统视频模型的交付物通常是一段内容。生成结束,模型的工作也就结束了。但一个社交角色、陪伴对象或者互动世界不止于此。它必须长期存在,持续接受另一个人的输入,并在每一次新的交互之后动态更新自己的状态。

这也是 Genesis-1.0 更大的产品野心。过去,构建一个长期在线的虚拟角色,开发者需要分别处理角色资产、剧情逻辑和各种事件反馈。内容制作和交互逻辑是两个高度依赖人工的割裂系统。生成式 AI 首先改变了前者。形界接下来想做的,是让模型继续吞掉后者。

他们并不只想把一个 AI 角色直接交到用户手里,而是希望把“持续在场、敏锐感知和即时回应”这些能力进一步沉淀为一种可被不同互动产品复用的底层基础设施。社交陪伴是目前最直接的落点,但这套能力同样可以延伸到直播、游戏 NPC、互动娱乐以及其他今天尚未成熟的产品形态中。

当一个模型能够理解用户、持续维持人物和环境状态,并根据交互直接决定下一刻发生什么,开发者得到的就不只是“生成一段视频的 API”,而开始接近一套新的互动内容生产方式——没有冗余系统,“模型即产品”。

但对商业落地而言,这件事最终要落到非常现实的问题上:一个角色能在线多久?用户一个动作以后要等多久?互动能否超越一张会说话的脸?以及当几千、几万名用户每天持续使用时,这套体验在经济上能不能成立?只有这些指标同时过线,实时视频才可能从模型 Demo 变成社交、陪伴、直播和互动娱乐真正可调用的一层基础设施。

形界特别看重社交场景,也正是因为它对这套技术提出的要求最完整。直播允许内容仍然以“主播”为中心,游戏可以预先规定大量交互规则,而社交需要模型真正围绕另一个人不断调整自己的行为——它既考验内容生成,也考验感知、理解和即时反馈。

对于一家刚成立数月的公司,形界没有选择先用很长时间去讲一个宏大的世界模型故事,再慢慢等待技术成熟,而是几乎每一个阶段都拿出能够被实际感知到的成果。Genesis-1.0 就是在这条务实路径上一次明确向产品层的收束:同时解决时长、行为、响应和成本这四个指标。

但技术走到这里以后,问题已经开始不同。

过去,用户打开一个 AI 产品,通常是为了得到一段内容或者一个答案:人输入需求,机器返回结果,交互是离散的。这种受限的信息带宽无法支撑起更加复杂的应用。而社交和陪伴需求是另一种深度关系——一个对象长期存在,精准感知用户现在的状态,并根据双方共同经历的历史持续互动。

文字很难承载这种关系,语音把它向前推了一步,而视频提供了更高的信息带宽。所以 Genesis-1.0 真正押注的,并不只是 AI 视频的下一次升级。它押注的是一种新的交互范式:让视频从 AI 生成的一次性结果,变成人和 AI 之间持续发生的交互本身。

过去的视频模型,往往以“生成完成”为终点。如果这条路线成立,那么下一代互动模型真正重要的竞争力,可能恰恰是:它不再轻易结束。

“无论你什么时候来,她都在。”点击链接进入 Genesis-1.0 直播间,和她打个招呼吧~

https://www.frame-x.ai/models/genesis





特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
揭秘锡安变瘦内幕!专家全方位改善身体状态 新赛季出勤率令人期待

揭秘锡安变瘦内幕!专家全方位改善身体状态 新赛季出勤率令人期待

罗说NBA
2026-10-01 07:06:57
华为Mate 90全系SKU出炉:共五款!顶配16GB+2TB

华为Mate 90全系SKU出炉:共五款!顶配16GB+2TB

快科技
2026-10-01 10:40:06
演员杜淳老婆直播自曝被骗灌肠排毒时被插错位置,结果被网友造黄谣...

演员杜淳老婆直播自曝被骗灌肠排毒时被插错位置,结果被网友造黄谣...

万能学爸
2026-09-29 23:29:07
全国外卖单量从2亿跌到1.1亿,美团单量断崖式下滑,骑手和商家最先扛不住

全国外卖单量从2亿跌到1.1亿,美团单量断崖式下滑,骑手和商家最先扛不住

帝都观日记
2026-09-29 14:35:08
爆料!华人持绿卡入境,被问是否放弃绿卡,拒绝后进“小黑屋”,连钱包夹层都被翻查

爆料!华人持绿卡入境,被问是否放弃绿卡,拒绝后进“小黑屋”,连钱包夹层都被翻查

华人生活网
2026-09-30 02:31:22
迪拜航空客机事故最新消息:机长和副驾驶受伤入院,迹象表明,一人“试图控制飞机并让其坠毁”;乘客讲述事故细节→

迪拜航空客机事故最新消息:机长和副驾驶受伤入院,迹象表明,一人“试图控制飞机并让其坠毁”;乘客讲述事故细节→

封面新闻
2026-09-30 21:00:06
139票赞成,0票反对,匈牙利传来新消息!

139票赞成,0票反对,匈牙利传来新消息!

故事终将光明磊落
2026-09-30 16:26:44
乌克兰“移交2名朝鲜战俘”给韩国,韩国要求道歉,泽连斯基:朝鲜俘虏老想自杀,抓2个不容易

乌克兰“移交2名朝鲜战俘”给韩国,韩国要求道歉,泽连斯基:朝鲜俘虏老想自杀,抓2个不容易

蓝星杂谈
2026-09-29 17:12:11
与王金平密谈2028后,卢秀燕公开谈两岸,跟郑丽文路线背道而驰

与王金平密谈2028后,卢秀燕公开谈两岸,跟郑丽文路线背道而驰

雅儿姐爱追剧
2026-10-01 06:06:13
司机依赖“智驾”跑高速,马上追尾前方车辆时智驾系统突然“甩锅”,司机:不到10米才给我操控根本来不及

司机依赖“智驾”跑高速,马上追尾前方车辆时智驾系统突然“甩锅”,司机:不到10米才给我操控根本来不及

吉刻新闻
2026-09-30 16:28:57
陈皮加一物,化掉一身痰和湿,痰湿没了,湿气少了,肺气足了

陈皮加一物,化掉一身痰和湿,痰湿没了,湿气少了,肺气足了

白米饭怎么吃
2026-07-01 10:42:55
王虹出席纽约大学举办的庆功宴,罕见未戴眼镜,参会学生:王虹教授很文静,很多人来找她合影签名

王虹出席纽约大学举办的庆功宴,罕见未戴眼镜,参会学生:王虹教授很文静,很多人来找她合影签名

极目新闻
2026-09-30 17:00:36
我33岁守寡,村里一光棍趁雨夜翻墙进来,我没喊人,给他煮了饺子

我33岁守寡,村里一光棍趁雨夜翻墙进来,我没喊人,给他煮了饺子

刺头体育
2026-10-01 08:22:27
吴石行刑前,据说汤恩伯两次向老蒋求情,蒋说:最多保障家眷周全

吴石行刑前,据说汤恩伯两次向老蒋求情,蒋说:最多保障家眷周全

优趣纪史记
2026-09-30 06:42:21
炸了!刚刚,一国党韩森当选首选总理!

炸了!刚刚,一国党韩森当选首选总理!

澳洲红领巾
2026-09-30 14:48:26
谈谈刘欢副教授的身份问题

谈谈刘欢副教授的身份问题

网络舆情和危机管理
2026-09-30 11:21:04
毛主席严厉批评彭雪枫搞“山头主义”,双方当场激烈交锋,彭雪枫拍案而起,高声回敬:“只有山头,没有主义。”

毛主席严厉批评彭雪枫搞“山头主义”,双方当场激烈交锋,彭雪枫拍案而起,高声回敬:“只有山头,没有主义。”

人生录
2026-09-30 14:26:34
白外套+黑瑜伽裤,人妻熟女的街头轻运动穿搭

白外套+黑瑜伽裤,人妻熟女的街头轻运动穿搭

只要高兴就好
2026-10-01 12:21:45
2年8706万美金!联盟第1!26岁状元瘦身成功,他不想再做禁区之王

2年8706万美金!联盟第1!26岁状元瘦身成功,他不想再做禁区之王

微评体育圈
2026-09-30 20:33:57
刘欢去世刚3天,荒唐一幕发生,与女学生婚外情传闻再次被曝光!

刘欢去世刚3天,荒唐一幕发生,与女学生婚外情传闻再次被曝光!

秋姐居
2026-09-30 14:37:46
2026-10-01 13:23:00
ZFinance
ZFinance
Z世代的一站式AI、科技和财经资讯
276文章数 22关注度
往期回顾 全部

科技要闻

华为Mate90系列发布,售价5999元起

头条要闻

媒体:日本可能举办了"史上最差亚运会" 槽点实在太多

头条要闻

媒体:日本可能举办了"史上最差亚运会" 槽点实在太多

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

手机
亲子
教育
公开课
军事航空

手机要闻

华为Mate 90 RS非凡大师发布:麒麟9050 Pro+双层OLED 12999元起

亲子要闻

爸爸一定要多带带儿子,搞好关系 这样到老不孤单

教育要闻

“用3块钱,买来儿子自卑三年”,家长补好的鞋子,儿子却死活不愿穿

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美防长宣布组建“自主作战司令部”

无障碍浏览 进入关怀版