音频接口
语音转文字、语音翻译与文字转语音,OpenAI Audio 兼容,含文件上传格式与音色语速参数。
音频接口与 OpenAI Audio API 兼容,共三个端点:
| 方法 | 路径 | 说明 | 请求格式 |
|---|---|---|---|
POST | /v1/audio/transcriptions | 语音转文字(STT) | multipart/form-data |
POST | /v1/audio/translations | 语音翻译(翻译成英文) | multipart/form-data |
POST | /v1/audio/speech | 文字转语音(TTS) | JSON |
语音转文字
/v1/audio/transcriptionsfilefile必填音频文件
modelstring必填转写模型,如 whisper-1、gpt-4o-transcribe
languagestring源语言 ISO-639-1 代码(如 zh、en),不提供则自动检测
promptstring引导文本,可改善专有名词识别
response_formatstring响应格式
默认值: jsonjson · text · srt · vtt · verbose_jsontemperaturenumber采样温度 0–1
timestamp_granularities[]string[]时间戳粒度,需配合 verbose_json
word · segment支持的音频格式(按文件扩展名识别):mp3、wav、flac、m4a、mp4、
ogg / oga、opus、aiff / aif / aifc、aac。
列表来自服务端音频解析器的实际支持范围;上游模型自身的格式限制以各模型为准。
webm 当前不可用——服务端时长解析器暂不支持该格式,请求会在转发上游前失败。
verbose_json 响应包含语言、时长与分段时间戳:
{
"task": "transcribe",
"language": "chinese",
"duration": 8.5,
"text": "完整转写文本……",
"segments": [
{ "id": 0, "start": 0.0, "end": 3.2, "text": "第一段" }
]
}
curl https://api.jimu.chat/v1/audio/transcriptions \
-H "Authorization: Bearer $JIMU_API_KEY" \
-F "file=@./meeting.mp3" \
-F "model=whisper-1" \
-F "language=zh" \
-F "response_format=verbose_json"
语音翻译
/v1/audio/translations字段与 transcriptions 相同(file、model、prompt、response_format、temperature),
区别是输出为英文文本——任意语种的音频都会被翻译并转写为英文。
curl https://api.jimu.chat/v1/audio/translations \
-H "Authorization: Bearer $JIMU_API_KEY" \
-F "file=@./speech_zh.mp3" \
-F "model=whisper-1"
文字转语音
/v1/audio/speechmodelstring必填TTS 模型,如 tts-1、tts-1-hd、gpt-4o-mini-tts
inputstring必填要合成语音的文本
voicestring必填音色。OpenAI 系:alloy、ash、ballad、coral、echo、fable、nova、onyx、sage、shimmer、verse
instructionsstring语气/风格指令(gpt-4o-mini-tts)
response_formatstring输出音频格式。兼容推荐值 mp3 / opus / aac / flac / wav / pcm,但不限于此、平台不统一校验,以具体模型与渠道为准(部分渠道对无法识别的值回退 mp3)
speednumber语速倍率,通常 0.25–4.0。平台不会把省略的值归一为 1.0——OpenAI 兼容模型一般由上游默认 1.0,但部分渠道会把零值直接下发,因此建议显式传值。实际默认与范围以模型为准
stream_formatstring传 sse 开启流式音频事件
响应直接是音频字节流(Content-Type 随 response_format 变化),保存为文件即可播放:
curl https://api.jimu.chat/v1/audio/speech \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $JIMU_API_KEY" \
-d '{
"model": "tts-1",
"input": "你好,这是积木平台的语音合成测试。",
"voice": "alloy",
"speed": 1.0
}' \
-o speech.mp3
voice 与 speed 的可用范围以具体模型为准,其他厂商 TTS 模型可能有各自的音色列表。