音频接口

语音转文字、语音翻译与文字转语音,OpenAI Audio 兼容,含文件上传格式与音色语速参数。

音频接口与 OpenAI Audio API 兼容,共三个端点:

方法路径说明请求格式
POST/v1/audio/transcriptions语音转文字(STT)multipart/form-data
POST/v1/audio/translations语音翻译(翻译成英文)multipart/form-data
POST/v1/audio/speech文字转语音(TTS)JSON

鉴权见 鉴权与令牌,通用错误码见 错误处理与请求追踪

语音转文字

POST/v1/audio/transcriptions
filefile必填

音频文件

modelstring必填

转写模型,如 whisper-1gpt-4o-transcribe

languagestring

源语言 ISO-639-1 代码(如 zhen),不提供则自动检测

promptstring

引导文本,可改善专有名词识别

response_formatstring

响应格式

默认值: jsonjson · text · srt · vtt · verbose_json
temperaturenumber

采样温度 0–1

timestamp_granularities[]string[]

时间戳粒度,需配合 verbose_json

word · segment

支持的音频格式(按文件扩展名识别):mp3wavflacm4amp4ogg / ogaopusaiff / aif / aifcaac。 列表来自服务端音频解析器的实际支持范围;上游模型自身的格式限制以各模型为准。 webm 当前不可用——服务端时长解析器暂不支持该格式,请求会在转发上游前失败。

verbose_json 响应包含语言、时长与分段时间戳:

响应200
{
  "task": "transcribe",
  "language": "chinese",
  "duration": 8.5,
  "text": "完整转写文本……",
  "segments": [
    { "id": 0, "start": 0.0, "end": 3.2, "text": "第一段" }
  ]
}
curl https://api.jimu.chat/v1/audio/transcriptions \
  -H "Authorization: Bearer $JIMU_API_KEY" \
  -F "file=@./meeting.mp3" \
  -F "model=whisper-1" \
  -F "language=zh" \
  -F "response_format=verbose_json"

语音翻译

POST/v1/audio/translations

字段与 transcriptions 相同(filemodelpromptresponse_formattemperature), 区别是输出为英文文本——任意语种的音频都会被翻译并转写为英文。

curl https://api.jimu.chat/v1/audio/translations \
  -H "Authorization: Bearer $JIMU_API_KEY" \
  -F "file=@./speech_zh.mp3" \
  -F "model=whisper-1"

文字转语音

POST/v1/audio/speech
modelstring必填

TTS 模型,如 tts-1tts-1-hdgpt-4o-mini-tts

inputstring必填

要合成语音的文本

voicestring必填

音色。OpenAI 系:alloyashballadcoralechofablenovaonyxsageshimmerverse

instructionsstring

语气/风格指令(gpt-4o-mini-tts

response_formatstring

输出音频格式。兼容推荐值 mp3 / opus / aac / flac / wav / pcm,但不限于此、平台不统一校验,以具体模型与渠道为准(部分渠道对无法识别的值回退 mp3

speednumber

语速倍率,通常 0.25–4.0。平台不会把省略的值归一为 1.0——OpenAI 兼容模型一般由上游默认 1.0,但部分渠道会把零值直接下发,因此建议显式传值。实际默认与范围以模型为准

stream_formatstring

sse 开启流式音频事件

响应直接是音频字节流(Content-Typeresponse_format 变化),保存为文件即可播放:

curl https://api.jimu.chat/v1/audio/speech \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $JIMU_API_KEY" \
  -d '{
    "model": "tts-1",
    "input": "你好,这是积木平台的语音合成测试。",
    "voice": "alloy",
    "speed": 1.0
  }' \
  -o speech.mp3
TTS 按文本字符与生成音频时长综合计费;STT 按音频时长计费。 voicespeed 的可用范围以具体模型为准,其他厂商 TTS 模型可能有各自的音色列表。