“过去两周,我看到越来越多人发布RTK、Ponytail这类token节省工具的测试结果。这是好事,但每个人用的任务、日志和输出格式都不一样,结果很难相互比较。”Tura维护者Yu在最新博客中写道。
为了解决这个问题,他将自己一直在用的基准框架开源了。这个框架能完成三件事:跑通基准测试流程,把日志和生产物收进统一的结果schema里,再让CI自动索引仓库里新增的任何结果。配套网站会把所有结果转成可对比的图表和详细的运行页面。
![]()
也就是说,如果你是工具开发者,现在可以把你的工具扔进同一套测试里跑一遍,提交结果文件夹作为pull request,CI会自动完成索引。你也能在本地复现评测,确认分数没问题再提交。
“我特别想听到大家对接下来的测试方向有什么建议,以及这个框架在哪些地方可能引入偏差。”Yu补充道。他在文末做了利益相关披露:自己同时维护Tura和这个基准框架。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.