跳到主要内容

Gemini 原生格式(语音生成)

部分 Gemini TTS 模型通过 generateContent 返回音频数据。请求体使用 Gemini 原生格式,不能与 OpenAI /v1/audio/speech 的字段直接混用。

请求示例​

curl -X POST "https://www.walmind.cn/v1beta/models/your-tts-model:generateContent" \
-H "Content-Type: application/json" \
-H "x-goog-api-key: $API_KEY" \
-d '{
"contents": [
{"parts": [{"text": "欢迎使用华明模型 API。"}]}
],
"generationConfig": {
"responseModalities": ["AUDIO"],
"speechConfig": {
"voiceConfig": {
"prebuiltVoiceConfig": {"voiceName": "your-voice"}
}
}
}
}'

生成的音频通常以响应 Part 中的 inlineData 返回,包含 MIME 类型和 Base64 数据。客户端应先解码 Base64,再按照 MIME 类型保存文件。可用 TTS 模型、音色和编码由渠道配置决定。