OpenAI 发布 GPT Transcribe 与 GPT Live Transcribe 语音转录模型

OpenAI 在 API 中加入 GPT Transcribe 与 GPT Live Transcribe。前者适合处理已录制的音频文件,价格为每分钟 0.0045 美元;后者面向麦克风、通话等实时音频流,价格为每分钟 0.017 美元。两款模型均可利用上下文、关键词和语言提示改善专有名词与多语言内容的转录。
OpenAI GPT Transcribe 与 GPT Live Transcribe 语音转录模型封面

两款模型处理不同的音频流程

GPT Transcribe 用于把已经录好的语音转成文字。开发者上传一段完整录音后,可以等待模型返回最终文本,也可以在文件处理期间接收逐步生成的文字。这里的“流式”是边处理文件边返回结果,音频本身仍是一份已经存在的录音。

GPT Live Transcribe 处理持续到达的实时音频,例如麦克风输入、电话或直播音频流。它会在说话过程中返回新增的文字片段,并在一段语音提交后给出完整转录。需要即时字幕、在线会议记录或通话文字化的应用,更适合采用这条路径。

两者的区别不在于是否能逐步显示文字,而在于音频从哪里来。已有录音走文件转录;仍在说、仍在传输的音频走实时转录。

GPT Transcribe 直接接入音频转录接口

文件转录通过 /v1/audio/transcriptions 接口调用,模型名填写 gpt-transcribe。单个文件最大 25 MB,支持 mp3mp4mpegmpgam4awavwebm 格式。返回结果包含转录文本和检测到的语言。

如果希望在处理完成前先看到部分结果,可以把 stream 设为 true。接口会持续返回新增文本,最后再给出完整转录。这适合较长录音的处理进度展示,但不等同于接收麦克风的实时音频。

普通录音转写不需要先设计复杂流程。上传文件、指定模型,再读取返回文本即可。需要区分不同说话人、输出单词时间戳、制作字幕格式或翻译成英文时,应选择对应的专用转录模型,而不是把这些任务交给 GPT Transcribe。

GPT Live Transcribe 面向实时连接

实时转录需要创建 type: "transcription" 的 Realtime 会话,并选择 gpt-live-transcribe。服务器端音频管线可以使用 WebSocket,浏览器里的音频输入可以使用 WebRTC。

应用把音频片段持续送入会话后,会收到增量转录事件。每个事件带来当前新增的文字;当一段音频被提交,接口再返回这段内容的最终转录。开发者可以自行决定何时提交一段语音,也可以配置语音活动检测,让服务器依据说话与停顿自动划分边界。

这个模型只负责把实时语音变成文字,不会像语音助手那样生成口头回答。做直播字幕、实时会议记录或通话转写时,这种职责更直接:应用拿到文字后,再决定是否用于搜索、摘要、存档或交给其他模型处理。

上下文提示帮助识别专有内容

两款模型都支持给转录补充上下文。开发者可以用自由文本描述录音主题,用关键词列出可能出现的人名、产品名、编号和行业术语,还可以给出预期输入语言。多语言录音或同一句话中切换语言时,可以同时提供多个语言提示。

这些关键词是识别提示,不是强制输出。只应放入录音中确实可能出现的词,并用实际音频检查结果,避免模型把没有说过的词带进转录。

对会议、客服通话和专业访谈来说,这项能力比只上传裸音频更实用。录音主题、客户编号、项目代号和产品名称都可以在请求中明确提供,减少模型仅凭发音猜测的范围。

价格按音频分钟计算

GPT Transcribe 的价格为每分钟 0.0045 美元,一小时录音约为 0.27 美元。GPT Live Transcribe 的价格为每分钟 0.017 美元,一小时实时音频约为 1.02 美元。

批量处理播客、采访或会议存档时,GPT Transcribe 的成本更低。只有业务确实需要边说边出字时,才需要为 GPT Live Transcribe 的实时处理方式付费。选择模型时,先判断音频是否已经录好,再判断用户能否等待文件处理完成,通常就能确定接入路径。