leon-ai--leon
758 行
26 KiB
JSON
758 行
26 KiB
JSON
{
|
|
"$schema": "../../../schemas/tool-schemas/tool.json",
|
|
"tool_id": "qwen3_tts",
|
|
"toolkit_id": "music_audio",
|
|
"name": "Qwen3-TTS",
|
|
"description": "A tool for text-to-speech, voice cloning, and voice design using Qwen3-TTS models.",
|
|
"icon_name": "qwen-ai-line",
|
|
"author": {
|
|
"name": "Louis Grenard",
|
|
"email": "louis@getleon.ai",
|
|
"url": "https://twitter.com/grenlouis"
|
|
},
|
|
"binaries": {
|
|
"linux-x86_64": "https://github.com/leon-ai/leon-binaries/releases/download/qwen3_tts-v1.0.1/qwen3_tts_1.0.1-linux-x86_64",
|
|
"linux-aarch64": "https://github.com/leon-ai/leon-binaries/releases/download/qwen3_tts-v1.0.1/qwen3_tts_1.0.1-linux-aarch64",
|
|
"macosx-x86_64": "https://github.com/leon-ai/leon-binaries/releases/download/qwen3_tts-v1.0.1/qwen3_tts_1.0.1-macosx-x86_64",
|
|
"macosx-arm64": "https://github.com/leon-ai/leon-binaries/releases/download/qwen3_tts-v1.0.1/qwen3_tts_1.0.1-macosx-arm64",
|
|
"win-amd64": "https://github.com/leon-ai/leon-binaries/releases/download/qwen3_tts-v1.0.1/qwen3_tts_1.0.1-win-amd64.exe"
|
|
},
|
|
"resources": {
|
|
"Qwen3-TTS-12Hz-1.7B-Base": [
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/generation_config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/merges.txt?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/model.safetensors?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/preprocessor_config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/tokenizer_config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/vocab.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/speech_tokenizer/config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/speech_tokenizer/configuration.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/speech_tokenizer/model.safetensors?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base/resolve/main/speech_tokenizer/preprocessor_config.json?download=true"
|
|
],
|
|
"Qwen3-TTS-12Hz-1.7B-VoiceDesign": [
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/generation_config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/merges.txt?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/model.safetensors?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/preprocessor_config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/tokenizer_config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/vocab.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/speech_tokenizer/config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/speech_tokenizer/configuration.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/speech_tokenizer/model.safetensors?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign/resolve/main/speech_tokenizer/preprocessor_config.json?download=true"
|
|
],
|
|
"Qwen3-TTS-12Hz-1.7B-CustomVoice": [
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/generation_config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/merges.txt?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/model.safetensors?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/preprocessor_config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/tokenizer_config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/vocab.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/speech_tokenizer/config.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/speech_tokenizer/configuration.json?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/speech_tokenizer/model.safetensors?download=true",
|
|
"https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/resolve/main/speech_tokenizer/preprocessor_config.json?download=true"
|
|
]
|
|
},
|
|
"functions": {
|
|
"synthesizeSpeech": {
|
|
"description": "Synthesize speech with optional voice cloning using Qwen3-TTS.",
|
|
"parameters": {
|
|
"type": "object",
|
|
"properties": {
|
|
"tasks": {
|
|
"oneOf": [
|
|
{
|
|
"type": "object",
|
|
"properties": {
|
|
"text": {
|
|
"type": "string"
|
|
},
|
|
"target_language": {
|
|
"type": "string"
|
|
},
|
|
"language": {
|
|
"type": "string"
|
|
},
|
|
"audio_path": {
|
|
"type": "string"
|
|
},
|
|
"output_path": {
|
|
"type": "string"
|
|
},
|
|
"speaker_reference_path": {
|
|
"type": "string"
|
|
},
|
|
"reference_audio_path": {
|
|
"type": "string"
|
|
},
|
|
"reference_text": {
|
|
"type": "string"
|
|
},
|
|
"x_vector_only_mode": {
|
|
"type": "boolean"
|
|
},
|
|
"max_new_tokens": {
|
|
"type": "number"
|
|
},
|
|
"do_sample": {
|
|
"type": "boolean"
|
|
},
|
|
"top_k": {
|
|
"type": "number"
|
|
},
|
|
"top_p": {
|
|
"type": "number"
|
|
},
|
|
"temperature": {
|
|
"type": "number"
|
|
},
|
|
"repetition_penalty": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_dosample": {
|
|
"type": "boolean"
|
|
},
|
|
"subtalker_top_k": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_top_p": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_temperature": {
|
|
"type": "number"
|
|
}
|
|
},
|
|
"required": [
|
|
"text"
|
|
],
|
|
"additionalProperties": true
|
|
},
|
|
{
|
|
"type": "array",
|
|
"items": {
|
|
"type": "object",
|
|
"properties": {
|
|
"text": {
|
|
"type": "string"
|
|
},
|
|
"target_language": {
|
|
"type": "string"
|
|
},
|
|
"language": {
|
|
"type": "string"
|
|
},
|
|
"audio_path": {
|
|
"type": "string"
|
|
},
|
|
"output_path": {
|
|
"type": "string"
|
|
},
|
|
"speaker_reference_path": {
|
|
"type": "string"
|
|
},
|
|
"reference_audio_path": {
|
|
"type": "string"
|
|
},
|
|
"reference_text": {
|
|
"type": "string"
|
|
},
|
|
"x_vector_only_mode": {
|
|
"type": "boolean"
|
|
},
|
|
"max_new_tokens": {
|
|
"type": "number"
|
|
},
|
|
"do_sample": {
|
|
"type": "boolean"
|
|
},
|
|
"top_k": {
|
|
"type": "number"
|
|
},
|
|
"top_p": {
|
|
"type": "number"
|
|
},
|
|
"temperature": {
|
|
"type": "number"
|
|
},
|
|
"repetition_penalty": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_dosample": {
|
|
"type": "boolean"
|
|
},
|
|
"subtalker_top_k": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_top_p": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_temperature": {
|
|
"type": "number"
|
|
}
|
|
},
|
|
"required": [
|
|
"text"
|
|
],
|
|
"additionalProperties": true
|
|
}
|
|
}
|
|
]
|
|
},
|
|
"device": {
|
|
"type": "string"
|
|
},
|
|
"nvidiaLibsPath": {
|
|
"type": "string"
|
|
},
|
|
"torchPath": {
|
|
"type": "string"
|
|
}
|
|
},
|
|
"required": [
|
|
"tasks"
|
|
]
|
|
}
|
|
},
|
|
"designVoice": {
|
|
"description": "Design a new voice using Qwen3-TTS voice design model.",
|
|
"parameters": {
|
|
"type": "object",
|
|
"properties": {
|
|
"tasks": {
|
|
"oneOf": [
|
|
{
|
|
"type": "object",
|
|
"properties": {
|
|
"text": {
|
|
"type": "string"
|
|
},
|
|
"target_language": {
|
|
"type": "string"
|
|
},
|
|
"language": {
|
|
"type": "string"
|
|
},
|
|
"instruct": {
|
|
"type": "string"
|
|
},
|
|
"audio_path": {
|
|
"type": "string"
|
|
},
|
|
"output_path": {
|
|
"type": "string"
|
|
},
|
|
"max_new_tokens": {
|
|
"type": "number"
|
|
},
|
|
"do_sample": {
|
|
"type": "boolean"
|
|
},
|
|
"top_k": {
|
|
"type": "number"
|
|
},
|
|
"top_p": {
|
|
"type": "number"
|
|
},
|
|
"temperature": {
|
|
"type": "number"
|
|
},
|
|
"repetition_penalty": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_dosample": {
|
|
"type": "boolean"
|
|
},
|
|
"subtalker_top_k": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_top_p": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_temperature": {
|
|
"type": "number"
|
|
}
|
|
},
|
|
"required": [
|
|
"text"
|
|
],
|
|
"additionalProperties": true
|
|
},
|
|
{
|
|
"type": "array",
|
|
"items": {
|
|
"type": "object",
|
|
"properties": {
|
|
"text": {
|
|
"type": "string"
|
|
},
|
|
"target_language": {
|
|
"type": "string"
|
|
},
|
|
"language": {
|
|
"type": "string"
|
|
},
|
|
"instruct": {
|
|
"type": "string"
|
|
},
|
|
"audio_path": {
|
|
"type": "string"
|
|
},
|
|
"output_path": {
|
|
"type": "string"
|
|
},
|
|
"max_new_tokens": {
|
|
"type": "number"
|
|
},
|
|
"do_sample": {
|
|
"type": "boolean"
|
|
},
|
|
"top_k": {
|
|
"type": "number"
|
|
},
|
|
"top_p": {
|
|
"type": "number"
|
|
},
|
|
"temperature": {
|
|
"type": "number"
|
|
},
|
|
"repetition_penalty": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_dosample": {
|
|
"type": "boolean"
|
|
},
|
|
"subtalker_top_k": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_top_p": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_temperature": {
|
|
"type": "number"
|
|
}
|
|
},
|
|
"required": [
|
|
"text"
|
|
],
|
|
"additionalProperties": true
|
|
}
|
|
}
|
|
]
|
|
},
|
|
"device": {
|
|
"type": "string"
|
|
},
|
|
"nvidiaLibsPath": {
|
|
"type": "string"
|
|
},
|
|
"torchPath": {
|
|
"type": "string"
|
|
}
|
|
},
|
|
"required": [
|
|
"tasks"
|
|
]
|
|
}
|
|
},
|
|
"customVoice": {
|
|
"description": "Synthesize speech with a custom voice prompt using Qwen3-TTS.",
|
|
"parameters": {
|
|
"type": "object",
|
|
"properties": {
|
|
"tasks": {
|
|
"oneOf": [
|
|
{
|
|
"type": "object",
|
|
"properties": {
|
|
"text": {
|
|
"type": "string"
|
|
},
|
|
"target_language": {
|
|
"type": "string"
|
|
},
|
|
"language": {
|
|
"type": "string"
|
|
},
|
|
"speaker": {
|
|
"type": "string",
|
|
"enum": [
|
|
"Vivian",
|
|
"Serena",
|
|
"Uncle_Fu",
|
|
"Dylan",
|
|
"Eric",
|
|
"Ryan",
|
|
"Aiden",
|
|
"Ono_Anna",
|
|
"Sohee"
|
|
]
|
|
},
|
|
"instruct": {
|
|
"type": "string"
|
|
},
|
|
"audio_path": {
|
|
"type": "string"
|
|
},
|
|
"output_path": {
|
|
"type": "string"
|
|
},
|
|
"max_new_tokens": {
|
|
"type": "number"
|
|
},
|
|
"do_sample": {
|
|
"type": "boolean"
|
|
},
|
|
"top_k": {
|
|
"type": "number"
|
|
},
|
|
"top_p": {
|
|
"type": "number"
|
|
},
|
|
"temperature": {
|
|
"type": "number"
|
|
},
|
|
"repetition_penalty": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_dosample": {
|
|
"type": "boolean"
|
|
},
|
|
"subtalker_top_k": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_top_p": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_temperature": {
|
|
"type": "number"
|
|
}
|
|
},
|
|
"required": [
|
|
"text",
|
|
"speaker"
|
|
],
|
|
"additionalProperties": true
|
|
},
|
|
{
|
|
"type": "array",
|
|
"items": {
|
|
"type": "object",
|
|
"properties": {
|
|
"text": {
|
|
"type": "string"
|
|
},
|
|
"target_language": {
|
|
"type": "string"
|
|
},
|
|
"language": {
|
|
"type": "string"
|
|
},
|
|
"speaker": {
|
|
"type": "string",
|
|
"enum": [
|
|
"Vivian",
|
|
"Serena",
|
|
"Uncle_Fu",
|
|
"Dylan",
|
|
"Eric",
|
|
"Ryan",
|
|
"Aiden",
|
|
"Ono_Anna",
|
|
"Sohee"
|
|
]
|
|
},
|
|
"instruct": {
|
|
"type": "string"
|
|
},
|
|
"audio_path": {
|
|
"type": "string"
|
|
},
|
|
"output_path": {
|
|
"type": "string"
|
|
},
|
|
"max_new_tokens": {
|
|
"type": "number"
|
|
},
|
|
"do_sample": {
|
|
"type": "boolean"
|
|
},
|
|
"top_k": {
|
|
"type": "number"
|
|
},
|
|
"top_p": {
|
|
"type": "number"
|
|
},
|
|
"temperature": {
|
|
"type": "number"
|
|
},
|
|
"repetition_penalty": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_dosample": {
|
|
"type": "boolean"
|
|
},
|
|
"subtalker_top_k": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_top_p": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_temperature": {
|
|
"type": "number"
|
|
}
|
|
},
|
|
"required": [
|
|
"text",
|
|
"speaker"
|
|
],
|
|
"additionalProperties": true
|
|
}
|
|
}
|
|
]
|
|
},
|
|
"device": {
|
|
"type": "string"
|
|
},
|
|
"nvidiaLibsPath": {
|
|
"type": "string"
|
|
},
|
|
"torchPath": {
|
|
"type": "string"
|
|
}
|
|
},
|
|
"required": [
|
|
"tasks"
|
|
]
|
|
}
|
|
},
|
|
"designThenSynthesize": {
|
|
"description": "Design a voice and then synthesize multiple texts with it.",
|
|
"parameters": {
|
|
"type": "object",
|
|
"properties": {
|
|
"tasks": {
|
|
"oneOf": [
|
|
{
|
|
"type": "object",
|
|
"properties": {
|
|
"design_text": {
|
|
"type": "string"
|
|
},
|
|
"design_language": {
|
|
"type": "string"
|
|
},
|
|
"design_instruct": {
|
|
"type": "string"
|
|
},
|
|
"texts": {
|
|
"type": "array",
|
|
"items": {
|
|
"type": "string"
|
|
}
|
|
},
|
|
"languages": {
|
|
"type": "array",
|
|
"items": {
|
|
"type": "string"
|
|
}
|
|
},
|
|
"output_paths": {
|
|
"type": "array",
|
|
"items": {
|
|
"type": "string"
|
|
}
|
|
},
|
|
"design_max_new_tokens": {
|
|
"type": "number"
|
|
},
|
|
"design_do_sample": {
|
|
"type": "boolean"
|
|
},
|
|
"design_top_k": {
|
|
"type": "number"
|
|
},
|
|
"design_top_p": {
|
|
"type": "number"
|
|
},
|
|
"design_temperature": {
|
|
"type": "number"
|
|
},
|
|
"design_repetition_penalty": {
|
|
"type": "number"
|
|
},
|
|
"design_subtalker_dosample": {
|
|
"type": "boolean"
|
|
},
|
|
"design_subtalker_top_k": {
|
|
"type": "number"
|
|
},
|
|
"design_subtalker_top_p": {
|
|
"type": "number"
|
|
},
|
|
"design_subtalker_temperature": {
|
|
"type": "number"
|
|
},
|
|
"max_new_tokens": {
|
|
"type": "number"
|
|
},
|
|
"do_sample": {
|
|
"type": "boolean"
|
|
},
|
|
"top_k": {
|
|
"type": "number"
|
|
},
|
|
"top_p": {
|
|
"type": "number"
|
|
},
|
|
"temperature": {
|
|
"type": "number"
|
|
},
|
|
"repetition_penalty": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_dosample": {
|
|
"type": "boolean"
|
|
},
|
|
"subtalker_top_k": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_top_p": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_temperature": {
|
|
"type": "number"
|
|
}
|
|
},
|
|
"required": [
|
|
"design_text",
|
|
"texts",
|
|
"output_paths"
|
|
],
|
|
"additionalProperties": true
|
|
},
|
|
{
|
|
"type": "array",
|
|
"items": {
|
|
"type": "object",
|
|
"properties": {
|
|
"design_text": {
|
|
"type": "string"
|
|
},
|
|
"design_language": {
|
|
"type": "string"
|
|
},
|
|
"design_instruct": {
|
|
"type": "string"
|
|
},
|
|
"texts": {
|
|
"type": "array",
|
|
"items": {
|
|
"type": "string"
|
|
}
|
|
},
|
|
"languages": {
|
|
"type": "array",
|
|
"items": {
|
|
"type": "string"
|
|
}
|
|
},
|
|
"output_paths": {
|
|
"type": "array",
|
|
"items": {
|
|
"type": "string"
|
|
}
|
|
},
|
|
"design_max_new_tokens": {
|
|
"type": "number"
|
|
},
|
|
"design_do_sample": {
|
|
"type": "boolean"
|
|
},
|
|
"design_top_k": {
|
|
"type": "number"
|
|
},
|
|
"design_top_p": {
|
|
"type": "number"
|
|
},
|
|
"design_temperature": {
|
|
"type": "number"
|
|
},
|
|
"design_repetition_penalty": {
|
|
"type": "number"
|
|
},
|
|
"design_subtalker_dosample": {
|
|
"type": "boolean"
|
|
},
|
|
"design_subtalker_top_k": {
|
|
"type": "number"
|
|
},
|
|
"design_subtalker_top_p": {
|
|
"type": "number"
|
|
},
|
|
"design_subtalker_temperature": {
|
|
"type": "number"
|
|
},
|
|
"max_new_tokens": {
|
|
"type": "number"
|
|
},
|
|
"do_sample": {
|
|
"type": "boolean"
|
|
},
|
|
"top_k": {
|
|
"type": "number"
|
|
},
|
|
"top_p": {
|
|
"type": "number"
|
|
},
|
|
"temperature": {
|
|
"type": "number"
|
|
},
|
|
"repetition_penalty": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_dosample": {
|
|
"type": "boolean"
|
|
},
|
|
"subtalker_top_k": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_top_p": {
|
|
"type": "number"
|
|
},
|
|
"subtalker_temperature": {
|
|
"type": "number"
|
|
}
|
|
},
|
|
"required": [
|
|
"design_text",
|
|
"texts",
|
|
"output_paths"
|
|
],
|
|
"additionalProperties": true
|
|
}
|
|
}
|
|
]
|
|
},
|
|
"device": {
|
|
"type": "string"
|
|
},
|
|
"nvidiaLibsPath": {
|
|
"type": "string"
|
|
},
|
|
"torchPath": {
|
|
"type": "string"
|
|
}
|
|
},
|
|
"required": [
|
|
"tasks"
|
|
]
|
|
}
|
|
}
|
|
}
|
|
}
|