为什么你跟语音助手说话,总觉得它在等你把话说完才回应?Gradium 从语音交互演进的角度给出了一个解释:现有语音模型大多在"听"与"说"之间轮换,而不是同时进行。这个细节,被它视为语音智能体体验的关键分水岭。
轮换式交互的问题在于,它处理不了附和与重叠表达。人类对话里,"嗯""对""我懂"这类反馈往往和对方说话同时发生,而轮换模型必须等一方停下来,另一方才能开口。Gradium 的主张是拆开处理:让轻量语音界面负责自然对话,把推理和工具调用交给后台文本模型,以此平衡实时感、智能能力与部署成本。
![]()
Agent 执行环境被单独拆了出来
Google 推出了可运行于 GKE 的开源 Agent Substrate。它的运行时用微型虚拟机或 gVisor 隔离代码,并通过网络网关约束访问。空闲时保存沙箱状态、释放算力,再按需恢复。
这套设计的重点,是为大量长生命周期智能体兼顾安全、低延迟与资源利用。把智能体执行环境与机器管理解耦,意味着沙箱不必一直占着算力,需要时再唤醒。
企业集成先划权限,再谈自动化
Anthropic 与 Salesforce 发布了测试版插件,让销售在既有权限内把 CRM、邮件与 Slack 信息带入 Claude。销售人员可以汇集账户、商机和销售管道的会前信息,并生成跟进内容。
但写入 Salesforce 之前,仍由销售人员确认。权限边界与人工审批,是这套企业级集成明确保留的两道关口。
本期早报还汇集了另外几条动态:
- 阶跃星辰发布 StepAudio 3 系列模型
- Pinterest 的 Manas 平台从 HNSW 演进到量化 SPANN,做内存优化
- 无问芯穹开源具身端侧推理引擎 APXInf
- Nous Research 用 1393 个子 Agent 重构 Hermes 代码库
- 分子之心 QuantaMind 登上 Science Advances
- Claude for Small Business 扩展
- Charlie Guo 谈语音智能体的三种模式
十条动态里,语音交互、Agent 执行基座和企业级集成各占一角。它们指向的方向并不相同,但都在回答同一个问题:当智能体从演示走向长期运行,哪些环节需要被重新设计。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.