OpenAI 引入两种转录模型:低延迟、更好理解上下文

发布于

IT之家 7 月 29 日消息,OpenAI 公司今天(7 月 29 日)在 X 平台发布公告,**宣布推出 GPT-Live-Transcribe 和 GPT-Transcribe 两种转录模型,并支持通过 API 方式调用。**

![OpenAI 转录模型](http://pic.zhso.org/2026/07/29/5b7c858348f0.png)

### 调用费用方面
- GPT-Live-Transcribe 转录费用为每分钟 0.017 美元(IT之家注:现汇率约合 0.12 元人民币)
- GPT-Transcribe 转录费用为每分钟 0.0045 美元(现汇率约合 0.03 元人民币)

OpenAI 官方表示相比公司此前模型,上述两种转录模型可以更好地理解上下文,并能在各种口音和语言的真实世界音频上提供更准确的转录,包括短语、数字、专业术语以及带有响亮背景噪音的语音。

GPT-Live-Transcribe 是专为低延迟实时转录而构建;而 GPT-Transcribe 可以优化已完成音频文件和批量工作负载的异步转录。

![GPT-Transcribe 用例](http://pic.zhso.org/2026/07/29/7c2cf50788c7.png)

在 Context Aware ASR 基准测试上,GPT-Transcribe 语义准确率从无自由形式上下文的 41.6% 提高到有上下文的 45.2%。

![转录错误率](http://pic.zhso.org/2026/07/29/9e8d68a5d45f.png)

在 Common Voice 的 22 种语言上,GPT-Transcribe 的转录错误率为 19.27%,而 Whisper (whisper-1) 为 40.37%。在真实世界音频录制基准的九种语言上,它实现了 8.98% 的转录错误率,而 Whisper (whisper-1) 为 15.21%。

---

原文链接:[点击查看](https://www.ithome.com/0/982/801.htm)

评论

暂无评论。

0.035763s