Generates coherent mixed audio scenes (speech, music, SFX, ambience) from text using an LLM-driven model, with speech i…
Generates coherent mixed audio scenes (speech, music, SFX, ambience) from text using an LLM-driven model, with speech in 9 languages and emotion control.
sandraschi
mcp
free