Skip to main content

概述

将任何受支持语言的音频翻译为英文文本。与转录不同,此端点无论输入语言是什么,始终输出英文文本。

请求体

同步请求超时: 这个非聊天端点会等待路由到的模型完成处理。大输入、长音频或大批量请求可能超过常见的 30s 客户端默认超时,因此请将 HTTP 客户端超时设置为至少 120s
file
必填
要翻译的音频文件。支持的格式:flacmp3mp4mpegmpgam4aoggwavwebm。最大文件大小为 25 MB。
string
默认值:"whisper-1"
要使用的模型。当前仅支持 whisper-1
string
用于引导模型风格或续写上一段内容的可选文本。应使用英文。
string
默认值:"json"
输出格式。可选值:jsontextsrtverbose_jsonvtt
number
采样温度,取值范围在 0 到 1 之间。较高的值(如 0.8)会产生更随机的输出,而较低的值(如 0.2)会使输出更集中且更具确定性。

响应

string
英文翻译文本。
对于 verbose_json 格式,响应还包括:
string
输入音频检测出的语言。
number
输入音频的时长,单位为秒。
array
带时间戳的翻译文本分段。

翻译与转录

翻译端点会自动检测源语言并将其翻译为英文。转录中的 language 参数会被忽略。