短答:如果模型元数据不支持语音转文字(speech-to-text),请保持功能开关关闭,并把音频路由到经过验证的备用提供商。一个 OpenAI 兼容的一键接入表面,并不能证明 ASR 真的可用。
把语音转文字当作能力决策,而不是端点决策。对于使用单一密钥的 OpenAI 兼容应用,应首先检查模型目录,把转写功能放在特性开关之后,并在目标环境无法提供 ASR 时,把音频路由到独立验证过的备用方案。
这个差别看起来很小,却会改变产品行为:上传控件可以在用户开始一个走不通的流程之前就被禁用,而聊天和图像功能仍可运行在同一运行时上。我的验收约束是端到端文本能够进入 RAG 或 agent 评估框架,而不是一个看起来熟悉的请求。我使用 10 秒探测超时和四次尝试做发现检查,然后缓存结果,而不是让每次上传都执行基础设施层面的工作。
为什么 OpenAI 兼容 URL 不能证明转写功能就绪:兼容性描述的是客户端调用的形态,并不保证每个区域都支持每种模态。在当前能力快照中,/v1/audio/transcriptions 这个端点形态虽然存在,但模型目录中的 ASR 条目被标记为 available=false。这是一个能力边界,应用应当针对该环境报告转写不可用,并选择备用策略。
这一区分对 notebook 到生产的路径很有用。notebook 可以直接发送一个样本文件,看起来一切正常,直到生产环境的区域、模型或保留策略发生变化。一个在启动时读取 /v1/models(并定期刷新)的服务,会获得一个可缓存、可暴露给 UI、并可附加到评估运行的事实。当部署配置了特定 ASR 模型时,按模型读取的元数据能给出更精确的检查。
单一密钥仍然很方便。Infrai 提供的是纯 REST 接口,因此一个小型 Python worker 或 Node.js 服务就能完成能力发现与缓存,并在能力边界内决定启用还是降级。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.