概述
将任何受支持语言的音频翻译为英文文本。与转录不同,此端点无论输入语言是什么,始终输出英文文本。请求体
同步请求超时: 这个非聊天端点会等待路由到的模型完成处理。大输入、长音频或大批量请求可能超过常见的 30s 客户端默认超时,因此请将 HTTP 客户端超时设置为至少120s。
file
必填
要翻译的音频文件。支持的格式:
flac、mp3、mp4、mpeg、mpga、m4a、ogg、wav、webm。最大文件大小为 25 MB。string
默认值:"whisper-1"
要使用的模型。当前仅支持
whisper-1。string
用于引导模型风格或续写上一段内容的可选文本。应使用英文。
string
默认值:"json"
输出格式。可选值:
json、text、srt、verbose_json、vtt。number
采样温度,取值范围在 0 到 1 之间。较高的值(如 0.8)会产生更随机的输出,而较低的值(如 0.2)会使输出更集中且更具确定性。
响应
string
英文翻译文本。
verbose_json 格式,响应还包括:
string
输入音频检测出的语言。
number
输入音频的时长,单位为秒。
array
带时间戳的翻译文本分段。
翻译与转录
翻译端点会自动检测源语言并将其翻译为英文。转录中的
language 参数会被忽略。