机器人做动作,最怕的不是算得不准,是算得太慢。感知、决策、执行,整套流程必须在极短时间内完成闭环,这是具身智能从演示走向规模化应用绕不开的一道关卡。
无问芯穹联合清华大学、上海交通大学,开源了一款面向具身智能的端侧推理引擎 APXInf。它给出的数字是:PI 0.5 FP8 模型在 Jetson Thor 上的端到端推理延迟,从 278ms 降到 26ms 以内。
![]()
快,不是单点快
APXInf 的优化思路,不是去追某一个模型算子的峰值性能,而是围绕机器人真实执行链路做端到端优化。它覆盖了 Pipeline、Graph、Kernel 和量化等多个层面,把整条推理链路串起来调。
最终的结果是延迟最低压到 26ms,频率可达 38.46 Hz。对机器人实时感知与控制来说,这个响应空间是实打实的余量。
稳,靠的是 Rust 和极简
延迟之外,另一个容易被忽视的问题是长时间运行的稳定性。APXInf 用 Rust 语言构建极简运行时,借助其内存安全特性降低运行开销和易错面。它强调的是真实部署环境中的可预测性和持续运行能力,而不是实验室里的一次跑分。
同时,它通过 Python 接口做封装,保留了开发者熟悉的调用方式。底层用 Rust 扛稳定性,上层用 Python 保易用性,这个组合对实际接入的团队比较友好。
接入新模型,成本要低
具身智能的模型迭代速度快,如果每换一个模型都要重做一遍优化,工程成本会很难承受。APXInf 采用 Agentic Engineering 理念,通过冗余特性、功能隔离和工具箱模型等方法,降低新模型的接入和优化成本。
这套设计允许开发者快速验证模型能力,并支持持续扩展。换句话说,它要解决的不只是某一个模型的部署门槛,而是探索一种面向 Agentic Engineering 时代的推理系统构建范式。
为什么这件事值得关注
具身智能现在最缺的,往往不是更聪明的模型,而是能把模型稳定跑在机器人本体上的工程底座。延迟、稳定性、接入效率,这三件事任何一件掉链子,都会卡住从 POC 到规模化落地的路。
- 延迟:278ms 到 26ms 以内,频率 38.46 Hz
- 稳定性:Rust 极简运行时,内存安全降低易错面
- 易用性:Python 接口封装,保留熟悉调用方式
- 可扩展:Agentic Engineering 理念,降低新模型接入成本
APXInf 由无问芯穹联合清华大学、上海交通大学开源,定位是具身智能端侧推理引擎。它想证明的是,端侧推理这件事,还有不少可以重新设计的空间。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.