【CNMO科技消息】7月29日,OpenAI Developers官方宣布在API中推出两款语音转录模型。其中,GPT-Live-Transcribe面向低延迟实时转录场景,GPT-Transcribe则针对已完成音频文件的异步转录及批量处理任务进行优化。
![]()
OpenAI
OpenAI表示,两款模型进一步提升了上下文理解能力,在不同语言、口音及复杂真实环境中能够提供更准确的转录结果,尤其改善了短语、数字、专业术语以及强背景噪声下的识别表现。开发者还可以向模型提供录音内容简介、姓名及领域术语关键词、预期语言和前序转录内容,以提高识别准确率。
![]()
测试数据显示,在OpenAI新建立的上下文感知自动语音识别评测中,GPT-Live-Transcribe的语义准确率在未提供自由形式上下文时为38.5%,加入上下文后提高至44.6%。在覆盖22种语言的Common Voice测试中,其转录错误率为19.70%,略低于GPT-Realtime-Whisper-1的20.33%;在九种语言的真实录音测试中,两者分别为9.60%和11.65%。
GPT-Transcribe同样可以利用上下文提高表现,其语义准确率由41.6%升至45.2%。在Common Voice测试中,该模型的转录错误率为19.27%,相比Whisper-1的40.37%明显降低;真实录音测试中的错误率为8.98%,Whisper-1则为15.21%。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.