跑一次基准测试,最怕的不是模型不行,是本地机器先扛不住。Vercel 给出的解法是:把 Terminal-Bench、SWE-bench 这些评估任务,直接扔进云端的隔离环境里跑。
Vercel 已将开源 AI 基准测试框架 Harbor 集成到 Vercel Sandbox 中。开发者现在可以用一个 --env vercel 标志,在隔离的 Firecracker microVM 里执行 Terminal-Bench、SWE-bench 和 OSWorld 等基准测试。
![]()
每次测试,一个独立 microVM
这套集成最直接的变化是并行能力。按官方说法,每次测试都在其独立的隔离 Firecracker microVM 中执行,因此可以实现远超本地机器能力的并行化。
换句话说,过去受限于一台机器能开多少进程、内存够不够的评估任务,现在可以按需铺开。跑一批模型、跑一批任务,互不干扰。
密钥不进沙箱
安全设计上,Vercel 把网络策略的执行位置放在了 VM 之外。任务的网络策略在 VM 之外的沙箱防火墙上强制执行,而不是在沙箱内部。
凭据处理也遵循同样的思路。可选的凭据注入在防火墙处将密钥附加到匹配的出站请求中,因此它们永远不会进入沙箱环境。对于需要调用外部服务的评估任务来说,这一点直接决定了能不能放心跑。
换模型,只改一个参数
多模型对比是基准测试的常规动作,但不同供应商的接口、密钥、调用方式往往要各写一套。结合 Vercel AI Gateway,开发者只需更改 Harbor 命令中的 --model 参数,即可在来自不同供应商的数百个模型之间进行切换。
配合单个 API 密钥和简单的命令行标志,跨供应商的模型基准测试被压缩成了一条命令的事。
对于需要反复验证模型表现的团队来说,评估环节的门槛正在从"搭环境"变成"改参数"。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.