OpenAI近日宣布推出新的转录模型GPT-Live-Transcribe和GPT-Transcribe,分别面向实时语音转录以及音频文件异步转录场景。对此官方表示,这两款模型相比此前的方案进一步提升了上下文理解能力,并针对真实环境中的多语言、多口音语音识别进行了优化。

据了解,GPT-Live-Transcribe专为低延迟实时转录设计,可用于需要即时语音转换的场景,GPT-Transcribe则针对已完成音频文件的异步转录以及批量工作负载进行优化。两款模型均支持开发者通过提供录音背景信息、人名及领域术语关键词、预期输入语言,以及此前转录内容等方式,为实时音频转录提供更多上下文信息。
性能方面,OpenAI也公布了这两款模型在多项语音识别基准测试中的表现。在新的上下文感知自动语音识别测试中,GPT-Live-Transcribe加入自由形式上下文信息后,语义准确率由38.5%提升至44.6%,GPT-Transcribe的语义准确率则由41.6%提升至45.2%。

在Common Voice的22种语言测试中,GPT-Live-Transcribe的转录错误率为19.70%,GPT-Realtime-Whisper-1为 20.33%。而在真实世界音频录制基准的九种语言测试中,GPT-Live-Transcribe的转录错误率为9.60%,GPT-Realtime-Whisper-1是11.65%。
此外,GPT-Transcribe在多语言语音识别测试中也相比Whisper-1有所提升。在Common Voice的22种语言测试中,GPT-Transcribe的转录错误率为19.27%,Whisper-1则是40.37%;在真实世界音频录制基准测试中,GPT-Transcribe的转录错误率为8.98%,Whisper-1是15.21%。

目前,OpenAI已通过API开放GPT-Live-Transcribe和GPT-Transcribe这两款模型。其中,GPT-Live-Transcribe的调用价格为每分钟0.017美元(约合人民币 0.12 元),GPT-Transcribe则是每分钟0.0045美元(约合人民币 0.03 元)。
【本文图片来自网络】
