成本降十倍,才会出现全新产品品类
Sail Research 创始人 Neil Movva 在近期对话中提出一个判断:只要把某样东西便宜十倍,它就会成为一个全新的产品品类。落到 AI 推理上,他的目标是把 token 成本降低十倍,从而催生过去因成本过高而无法成立的产品形态。
![]()
Neil 认为,降低 token 成本比追求低延迟更重要。因为未来的 AI Agent 将主要在后台长时间运行,完成深度研究、网络安全、互联网索引等任务。低延迟不再是唯一指标,后台运行的 Agent 可以接受数小时甚至数天的运行周期,因此吞吐量优化比延迟优化更重要,这改变了整个技术栈的设计方向。
GPU 吞吐量与延迟的根本权衡
对话中,Neil 详细解释了 GPU 吞吐量与延迟之间的根本权衡,并拆解了 Tensor Core 与 NVLink 在其中的作用。他还提到 Cerebras 等新型加速器的潜力,以及 KV cache 对长上下文推理的瓶颈。
KV cache 随对话增长而动态变化,占用的内存常常超过模型权重本身,成为限制推理速度和成本的关键因素。Neil 认为,这需要混合计算方案来优化,而不是单纯堆叠更高端的芯片。
“拾荒者策略”:没有坏的芯片,只有不合理的价格
Neil 提出一套“拾荒者策略”:购买被低估的芯片,如 AMD、TPU、Trainium,并利用可用性较低的小型数据中心,甚至可用性仅 95% 的设施,通过自研软件实现异构调度,以极低成本提供推理服务。
他的原话是:“没有坏的芯片。只有不合理的价格。” 这套思路的核心不是追逐最新最强的硬件,而是把分散、被低估的算力组合成高效的推理网络。Neil 还表示,他会买 95% 可用性的数据中心,因为这类资源的价格远低于高可用性设施,而长周期后台 Agent 恰好能容忍一定程度的不可用。
从互联网数据转向强化学习环境
Neil 还讨论了 Transformer 的可扩展性,以及数据来源的转变。他认为互联网数据已近枯竭,未来模型将通过可验证任务和强化学习环境实现自我提升,这比随机人类反馈更有效。
这一判断与他对英伟达的逆向观点相关。对话中,Neil 讨论了英伟达的供应链瓶颈,并表达了对英伟达短期看好的逆向观点。他没有把芯片供应紧张视为不可逾越的障碍,而是认为软件优化、异构芯片和分散式基础设施可以绕开部分瓶颈。
让智能变得充裕,让机器持续思考
Neil 的核心愿景是让智能变得充裕,使机器能够持续思考,让每个人都能负担得起智能服务。他提到一种说法:“最好的延迟就是完全没有延迟。” 当 Agent 在后台长时间运行时,用户不必实时等待每一次回复,反而能释放更多工作空间。
他还指出一个容易被忽视的瓶颈:随着你不断给 agent 发 prompt 并等待回复,你参与的越多,实际上你反而成了决定 Agent 能做多少工作的瓶颈。换句话说,真正限制长周期 Agent 效率的,可能不是模型速度,而是人的参与频率。
这场对话来自“跨国串门儿计划”,完整内容为播客形式,阅读时长约 121 分钟,字数约 30076 字。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.