项目文件夹

文件

758 行
26 KiB
JSON

{
"$schema": "../../../schemas/tool-schemas/tool.json",
"tool_id": "qwen3_tts",
"toolkit_id": "music_audio",
"name": "Qwen3-TTS",
"description": "A tool for text-to-speech, voice cloning, and voice design using Qwen3-TTS models.",
"icon_name": "qwen-ai-line",
"author": {
"name": "Louis Grenard",
"email": "louis@getleon.ai",
"url": "https://twitter.com/grenlouis"
},
"binaries": {
"linux-x86_64": "https://github.com/leon-ai/leon-binaries/releases/download/qwen3_tts-v1.0.1/qwen3_tts_1.0.1-linux-x86_64",
"linux-aarch64": "https://github.com/leon-ai/leon-binaries/releases/download/qwen3_tts-v1.0.1/qwen3_tts_1.0.1-linux-aarch64",
"macosx-x86_64": "https://github.com/leon-ai/leon-binaries/releases/download/qwen3_tts-v1.0.1/qwen3_tts_1.0.1-macosx-x86_64",
"macosx-arm64": "https://github.com/leon-ai/leon-binaries/releases/download/qwen3_tts-v1.0.1/qwen3_tts_1.0.1-macosx-arm64",
"win-amd64": "https://github.com/leon-ai/leon-binaries/releases/download/qwen3_tts-v1.0.1/qwen3_tts_1.0.1-win-amd64.exe"
},
"resources": {
"Qwen3-TTS-12Hz-1.7B-Base": [
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/generation_config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/merges.txt?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/model.safetensors?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/preprocessor_config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/tokenizer_config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/vocab.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/speech_tokenizer/config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/speech_tokenizer/configuration.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/speech_tokenizer/model.safetensors?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/speech_tokenizer/preprocessor_config.json?download=true"
],
"Qwen3-TTS-12Hz-1.7B-VoiceDesign": [
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/generation_config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/merges.txt?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/model.safetensors?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/preprocessor_config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/tokenizer_config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/vocab.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/speech_tokenizer/config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/speech_tokenizer/configuration.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/speech_tokenizer/model.safetensors?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/speech_tokenizer/preprocessor_config.json?download=true"
],
"Qwen3-TTS-12Hz-1.7B-CustomVoice": [
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/generation_config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/merges.txt?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/model.safetensors?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/preprocessor_config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/tokenizer_config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/vocab.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/speech_tokenizer/config.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/speech_tokenizer/configuration.json?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/speech_tokenizer/model.safetensors?download=true",
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/speech_tokenizer/preprocessor_config.json?download=true"
]
},
"functions": {
"synthesizeSpeech": {
"description": "Synthesize speech with optional voice cloning using Qwen3-TTS.",
"parameters": {
"type": "object",
"properties": {
"tasks": {
"oneOf": [
{
"type": "object",
"properties": {
"text": {
"type": "string"
},
"target_language": {
"type": "string"
},
"language": {
"type": "string"
},
"audio_path": {
"type": "string"
},
"output_path": {
"type": "string"
},
"speaker_reference_path": {
"type": "string"
},
"reference_audio_path": {
"type": "string"
},
"reference_text": {
"type": "string"
},
"x_vector_only_mode": {
"type": "boolean"
},
"max_new_tokens": {
"type": "number"
},
"do_sample": {
"type": "boolean"
},
"top_k": {
"type": "number"
},
"top_p": {
"type": "number"
},
"temperature": {
"type": "number"
},
"repetition_penalty": {
"type": "number"
},
"subtalker_dosample": {
"type": "boolean"
},
"subtalker_top_k": {
"type": "number"
},
"subtalker_top_p": {
"type": "number"
},
"subtalker_temperature": {
"type": "number"
}
},
"required": [
"text"
],
"additionalProperties": true
},
{
"type": "array",
"items": {
"type": "object",
"properties": {
"text": {
"type": "string"
},
"target_language": {
"type": "string"
},
"language": {
"type": "string"
},
"audio_path": {
"type": "string"
},
"output_path": {
"type": "string"
},
"speaker_reference_path": {
"type": "string"
},
"reference_audio_path": {
"type": "string"
},
"reference_text": {
"type": "string"
},
"x_vector_only_mode": {
"type": "boolean"
},
"max_new_tokens": {
"type": "number"
},
"do_sample": {
"type": "boolean"
},
"top_k": {
"type": "number"
},
"top_p": {
"type": "number"
},
"temperature": {
"type": "number"
},
"repetition_penalty": {
"type": "number"
},
"subtalker_dosample": {
"type": "boolean"
},
"subtalker_top_k": {
"type": "number"
},
"subtalker_top_p": {
"type": "number"
},
"subtalker_temperature": {
"type": "number"
}
},
"required": [
"text"
],
"additionalProperties": true
}
}
]
},
"device": {
"type": "string"
},
"nvidiaLibsPath": {
"type": "string"
},
"torchPath": {
"type": "string"
}
},
"required": [
"tasks"
]
}
},
"designVoice": {
"description": "Design a new voice using Qwen3-TTS voice design model.",
"parameters": {
"type": "object",
"properties": {
"tasks": {
"oneOf": [
{
"type": "object",
"properties": {
"text": {
"type": "string"
},
"target_language": {
"type": "string"
},
"language": {
"type": "string"
},
"instruct": {
"type": "string"
},
"audio_path": {
"type": "string"
},
"output_path": {
"type": "string"
},
"max_new_tokens": {
"type": "number"
},
"do_sample": {
"type": "boolean"
},
"top_k": {
"type": "number"
},
"top_p": {
"type": "number"
},
"temperature": {
"type": "number"
},
"repetition_penalty": {
"type": "number"
},
"subtalker_dosample": {
"type": "boolean"
},
"subtalker_top_k": {
"type": "number"
},
"subtalker_top_p": {
"type": "number"
},
"subtalker_temperature": {
"type": "number"
}
},
"required": [
"text"
],
"additionalProperties": true
},
{
"type": "array",
"items": {
"type": "object",
"properties": {
"text": {
"type": "string"
},
"target_language": {
"type": "string"
},
"language": {
"type": "string"
},
"instruct": {
"type": "string"
},
"audio_path": {
"type": "string"
},
"output_path": {
"type": "string"
},
"max_new_tokens": {
"type": "number"
},
"do_sample": {
"type": "boolean"
},
"top_k": {
"type": "number"
},
"top_p": {
"type": "number"
},
"temperature": {
"type": "number"
},
"repetition_penalty": {
"type": "number"
},
"subtalker_dosample": {
"type": "boolean"
},
"subtalker_top_k": {
"type": "number"
},
"subtalker_top_p": {
"type": "number"
},
"subtalker_temperature": {
"type": "number"
}
},
"required": [
"text"
],
"additionalProperties": true
}
}
]
},
"device": {
"type": "string"
},
"nvidiaLibsPath": {
"type": "string"
},
"torchPath": {
"type": "string"
}
},
"required": [
"tasks"
]
}
},
"customVoice": {
"description": "Synthesize speech with a custom voice prompt using Qwen3-TTS.",
"parameters": {
"type": "object",
"properties": {
"tasks": {
"oneOf": [
{
"type": "object",
"properties": {
"text": {
"type": "string"
},
"target_language": {
"type": "string"
},
"language": {
"type": "string"
},
"speaker": {
"type": "string",
"enum": [
"Vivian",
"Serena",
"Uncle_Fu",
"Dylan",
"Eric",
"Ryan",
"Aiden",
"Ono_Anna",
"Sohee"
]
},
"instruct": {
"type": "string"
},
"audio_path": {
"type": "string"
},
"output_path": {
"type": "string"
},
"max_new_tokens": {
"type": "number"
},
"do_sample": {
"type": "boolean"
},
"top_k": {
"type": "number"
},
"top_p": {
"type": "number"
},
"temperature": {
"type": "number"
},
"repetition_penalty": {
"type": "number"
},
"subtalker_dosample": {
"type": "boolean"
},
"subtalker_top_k": {
"type": "number"
},
"subtalker_top_p": {
"type": "number"
},
"subtalker_temperature": {
"type": "number"
}
},
"required": [
"text",
"speaker"
],
"additionalProperties": true
},
{
"type": "array",
"items": {
"type": "object",
"properties": {
"text": {
"type": "string"
},
"target_language": {
"type": "string"
},
"language": {
"type": "string"
},
"speaker": {
"type": "string",
"enum": [
"Vivian",
"Serena",
"Uncle_Fu",
"Dylan",
"Eric",
"Ryan",
"Aiden",
"Ono_Anna",
"Sohee"
]
},
"instruct": {
"type": "string"
},
"audio_path": {
"type": "string"
},
"output_path": {
"type": "string"
},
"max_new_tokens": {
"type": "number"
},
"do_sample": {
"type": "boolean"
},
"top_k": {
"type": "number"
},
"top_p": {
"type": "number"
},
"temperature": {
"type": "number"
},
"repetition_penalty": {
"type": "number"
},
"subtalker_dosample": {
"type": "boolean"
},
"subtalker_top_k": {
"type": "number"
},
"subtalker_top_p": {
"type": "number"
},
"subtalker_temperature": {
"type": "number"
}
},
"required": [
"text",
"speaker"
],
"additionalProperties": true
}
}
]
},
"device": {
"type": "string"
},
"nvidiaLibsPath": {
"type": "string"
},
"torchPath": {
"type": "string"
}
},
"required": [
"tasks"
]
}
},
"designThenSynthesize": {
"description": "Design a voice and then synthesize multiple texts with it.",
"parameters": {
"type": "object",
"properties": {
"tasks": {
"oneOf": [
{
"type": "object",
"properties": {
"design_text": {
"type": "string"
},
"design_language": {
"type": "string"
},
"design_instruct": {
"type": "string"
},
"texts": {
"type": "array",
"items": {
"type": "string"
}
},
"languages": {
"type": "array",
"items": {
"type": "string"
}
},
"output_paths": {
"type": "array",
"items": {
"type": "string"
}
},
"design_max_new_tokens": {
"type": "number"
},
"design_do_sample": {
"type": "boolean"
},
"design_top_k": {
"type": "number"
},
"design_top_p": {
"type": "number"
},
"design_temperature": {
"type": "number"
},
"design_repetition_penalty": {
"type": "number"
},
"design_subtalker_dosample": {
"type": "boolean"
},
"design_subtalker_top_k": {
"type": "number"
},
"design_subtalker_top_p": {
"type": "number"
},
"design_subtalker_temperature": {
"type": "number"
},
"max_new_tokens": {
"type": "number"
},
"do_sample": {
"type": "boolean"
},
"top_k": {
"type": "number"
},
"top_p": {
"type": "number"
},
"temperature": {
"type": "number"
},
"repetition_penalty": {
"type": "number"
},
"subtalker_dosample": {
"type": "boolean"
},
"subtalker_top_k": {
"type": "number"
},
"subtalker_top_p": {
"type": "number"
},
"subtalker_temperature": {
"type": "number"
}
},
"required": [
"design_text",
"texts",
"output_paths"
],
"additionalProperties": true
},
{
"type": "array",
"items": {
"type": "object",
"properties": {
"design_text": {
"type": "string"
},
"design_language": {
"type": "string"
},
"design_instruct": {
"type": "string"
},
"texts": {
"type": "array",
"items": {
"type": "string"
}
},
"languages": {
"type": "array",
"items": {
"type": "string"
}
},
"output_paths": {
"type": "array",
"items": {
"type": "string"
}
},
"design_max_new_tokens": {
"type": "number"
},
"design_do_sample": {
"type": "boolean"
},
"design_top_k": {
"type": "number"
},
"design_top_p": {
"type": "number"
},
"design_temperature": {
"type": "number"
},
"design_repetition_penalty": {
"type": "number"
},
"design_subtalker_dosample": {
"type": "boolean"
},
"design_subtalker_top_k": {
"type": "number"
},
"design_subtalker_top_p": {
"type": "number"
},
"design_subtalker_temperature": {
"type": "number"
},
"max_new_tokens": {
"type": "number"
},
"do_sample": {
"type": "boolean"
},
"top_k": {
"type": "number"
},
"top_p": {
"type": "number"
},
"temperature": {
"type": "number"
},
"repetition_penalty": {
"type": "number"
},
"subtalker_dosample": {
"type": "boolean"
},
"subtalker_top_k": {
"type": "number"
},
"subtalker_top_p": {
"type": "number"
},
"subtalker_temperature": {
"type": "number"
}
},
"required": [
"design_text",
"texts",
"output_paths"
],
"additionalProperties": true
}
}
]
},
"device": {
"type": "string"
},
"nvidiaLibsPath": {
"type": "string"
},
"torchPath": {
"type": "string"
}
},
"required": [
"tasks"
]
}
}
}
}