Skip to main content

请求体

同步请求超时: 这个非聊天端点会等待路由到的模型完成处理。大输入、长音频或大批量请求可能超过常见的 30s 客户端默认超时,因此请将 HTTP 客户端超时设置为至少 120s
file
必填
要转录的音频文件。支持的格式:flac、mp3、mp4、mpeg、mpga、m4a、ogg、wav、webm。
string
默认值:"whisper-1"
要使用的模型。目前仅支持 whisper-1
string
音频的语言,采用 ISO-639-1 格式(例如:enzhja)。
string
可选文本,用于引导模型的风格或续接上一段内容。
string
默认值:"json"
输出格式:jsontextsrtverbose_jsonvtt
number
默认值:"0"
采样温度(0 到 1)。
array
时间戳粒度:word 和/或 segment。需要 verbose_json

响应

string
转录后的文本。
对于 verbose_json
string
始终为 transcribe
string
检测到的语言。
number
音频时长,单位为秒。
array
带时间戳的转录片段。
array
词级时间戳(如已请求)。

翻译

要将音频翻译为英语,请使用 translations endpoint: