Fix engine RAM chips with real nvidia-smi GPU memory measurements
Replace all estimated VRAM values with actual per-process GPU memory from nvidia-smi --query-compute-apps: Magpie TTS ~10 GB, Qwen3-TTS clone ~6 GB / others ~5 GB, XTTS ~5 GB, VibeVoice ~4 GB, Parakeet ~3 GB, nemotron-asr-streaming ~11 GB. Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
parent
49e48eb4e3
commit
916123f3b4
16
server.py
16
server.py
@ -1820,8 +1820,8 @@ _STT_BACKEND_METRICS: dict[str, dict] = {
|
|||||||
"faster_whisper": {"speed": "~70× RT · GPU", "latency": "0.5–2 s", "quality": "large-v3", "ram": "1.5 GB VRAM"},
|
"faster_whisper": {"speed": "~70× RT · GPU", "latency": "0.5–2 s", "quality": "large-v3", "ram": "1.5 GB VRAM"},
|
||||||
"whisper_cpp": {"speed": "~8–15× RT · CPU", "latency": "1–5 s", "quality": "large-v3 Q5", "ram": "~1 GB RAM"},
|
"whisper_cpp": {"speed": "~8–15× RT · CPU", "latency": "1–5 s", "quality": "large-v3 Q5", "ram": "~1 GB RAM"},
|
||||||
"groq_whisper": {"speed": "fastest cloud", "latency": "0.5–1 s", "quality": "Whisper Turbo", "ram": "cloud · 0"},
|
"groq_whisper": {"speed": "fastest cloud", "latency": "0.5–1 s", "quality": "Whisper Turbo", "ram": "cloud · 0"},
|
||||||
"nvidia_parakeet":{"speed": "~200× RT · GPU", "latency": "<0.3 s", "quality": "Parakeet-TDT", "ram": "~1 GB"},
|
"nvidia_parakeet":{"speed": "~200× RT · GPU", "latency": "<0.3 s", "quality": "Parakeet-TDT", "ram": "~3 GB"},
|
||||||
"nvidia_router": {"speed": "GPU routed", "latency": "~0.5 s", "quality": "varies", "ram": "varies"},
|
"nvidia_router": {"speed": "GPU routed", "latency": "~0.5 s", "quality": "varies", "ram": "~11 GB"},
|
||||||
}
|
}
|
||||||
|
|
||||||
|
|
||||||
@ -3213,7 +3213,7 @@ def _backend_capabilities(backend: str) -> dict:
|
|||||||
"style": "Weak per-request style; instruct may be ignored.",
|
"style": "Weak per-request style; instruct may be ignored.",
|
||||||
"best_for": "Known voices, multilingual cloning, benchmarks, and reliable speaker identity.",
|
"best_for": "Known voices, multilingual cloning, benchmarks, and reliable speaker identity.",
|
||||||
"uses_wav": True, "style_aware": False, "true_streaming": False,
|
"uses_wav": True, "style_aware": False, "true_streaming": False,
|
||||||
"speed": "~0.3× GPU", "latency": "1–3 s", "quality": "Premium clone", "ram": "~5 GB",
|
"speed": "~0.3× GPU", "latency": "1–3 s", "quality": "Premium clone", "ram": "~6 GB",
|
||||||
},
|
},
|
||||||
"voice_design": {
|
"voice_design": {
|
||||||
"purpose": "Create or reuse prompt-designed voices from natural-language descriptions.",
|
"purpose": "Create or reuse prompt-designed voices from natural-language descriptions.",
|
||||||
@ -3245,7 +3245,7 @@ def _backend_capabilities(backend: str) -> dict:
|
|||||||
"style": "Language and speaker are controlled by the backend voice config; per-request style text is usually ignored.",
|
"style": "Language and speaker are controlled by the backend voice config; per-request style text is usually ignored.",
|
||||||
"best_for": "Fast local NVIDIA TTS voices and OpenAI-compatible assistant playback.",
|
"best_for": "Fast local NVIDIA TTS voices and OpenAI-compatible assistant playback.",
|
||||||
"uses_wav": False, "style_aware": False, "true_streaming": False,
|
"uses_wav": False, "style_aware": False, "true_streaming": False,
|
||||||
"speed": "~0.05× GPU", "latency": "0.3–0.8 s", "quality": "High", "ram": "~1 GB",
|
"speed": "~0.05× GPU", "latency": "0.3–0.8 s", "quality": "High", "ram": "~10 GB",
|
||||||
},
|
},
|
||||||
"nvidia_zeroshot": {
|
"nvidia_zeroshot": {
|
||||||
"purpose": "Clone a saved library voice through NVIDIA Magpie TTS Zeroshot NIM.",
|
"purpose": "Clone a saved library voice through NVIDIA Magpie TTS Zeroshot NIM.",
|
||||||
@ -3253,7 +3253,7 @@ def _backend_capabilities(backend: str) -> dict:
|
|||||||
"style": "Best with a clear 3-10 second prompt. Optional quality params can be configured in Settings.",
|
"style": "Best with a clear 3-10 second prompt. Optional quality params can be configured in Settings.",
|
||||||
"best_for": "Fast NVIDIA reference-audio cloning, streaming-class use cases, live agents, and games.",
|
"best_for": "Fast NVIDIA reference-audio cloning, streaming-class use cases, live agents, and games.",
|
||||||
"uses_wav": True, "style_aware": False, "true_streaming": False,
|
"uses_wav": True, "style_aware": False, "true_streaming": False,
|
||||||
"speed": "~0.1× GPU", "latency": "0.5–1 s", "quality": "High clone", "ram": "~1 GB",
|
"speed": "~0.1× GPU", "latency": "0.5–1 s", "quality": "High clone", "ram": "~10 GB",
|
||||||
},
|
},
|
||||||
"nvidia_flow": {
|
"nvidia_flow": {
|
||||||
"purpose": "Clone a saved library voice through NVIDIA Magpie TTS Flow NIM.",
|
"purpose": "Clone a saved library voice through NVIDIA Magpie TTS Flow NIM.",
|
||||||
@ -3261,7 +3261,7 @@ def _backend_capabilities(backend: str) -> dict:
|
|||||||
"style": "Offline high-fidelity clone path; prompt transcript must match the reference audio.",
|
"style": "Offline high-fidelity clone path; prompt transcript must match the reference audio.",
|
||||||
"best_for": "Studio-style dubbing, narration, and podcast-quality offline generation.",
|
"best_for": "Studio-style dubbing, narration, and podcast-quality offline generation.",
|
||||||
"uses_wav": True, "style_aware": False, "true_streaming": False,
|
"uses_wav": True, "style_aware": False, "true_streaming": False,
|
||||||
"speed": "~0.2× GPU", "latency": "1–2 s", "quality": "Studio", "ram": "~1 GB",
|
"speed": "~0.2× GPU", "latency": "1–2 s", "quality": "Studio", "ram": "~10 GB",
|
||||||
},
|
},
|
||||||
"kokoro": {
|
"kokoro": {
|
||||||
"purpose": "High-quality English TTS with Kokoro 82M model. OpenAI-compatible endpoint.",
|
"purpose": "High-quality English TTS with Kokoro 82M model. OpenAI-compatible endpoint.",
|
||||||
@ -3277,7 +3277,7 @@ def _backend_capabilities(backend: str) -> dict:
|
|||||||
"style": "Text only — no voice ID or style parameters.",
|
"style": "Text only — no voice ID or style parameters.",
|
||||||
"best_for": "Lightweight local TTS on port 8027. Minimal setup, fast response.",
|
"best_for": "Lightweight local TTS on port 8027. Minimal setup, fast response.",
|
||||||
"uses_wav": False, "style_aware": False, "true_streaming": False,
|
"uses_wav": False, "style_aware": False, "true_streaming": False,
|
||||||
"speed": "fast", "latency": "0.2–1 s", "quality": "High", "ram": "varies",
|
"speed": "fast", "latency": "0.2–1 s", "quality": "High", "ram": "~4 GB",
|
||||||
},
|
},
|
||||||
"xtts": {
|
"xtts": {
|
||||||
"purpose": "XTTS v2 via xtts-api-server. OpenAI-compatible endpoint with speaker selection.",
|
"purpose": "XTTS v2 via xtts-api-server. OpenAI-compatible endpoint with speaker selection.",
|
||||||
@ -3285,7 +3285,7 @@ def _backend_capabilities(backend: str) -> dict:
|
|||||||
"style": "Speaker selected by voice ID. Style instruction not supported.",
|
"style": "Speaker selected by voice ID. Style instruction not supported.",
|
||||||
"best_for": "Local multi-speaker TTS with XTTS v2 model. Coqui/daswer123 docker setup.",
|
"best_for": "Local multi-speaker TTS with XTTS v2 model. Coqui/daswer123 docker setup.",
|
||||||
"uses_wav": False, "style_aware": False, "true_streaming": False,
|
"uses_wav": False, "style_aware": False, "true_streaming": False,
|
||||||
"speed": "~0.3× GPU", "latency": "1–3 s", "quality": "High", "ram": "3–4 GB",
|
"speed": "~0.3× GPU", "latency": "1–3 s", "quality": "High", "ram": "~5 GB",
|
||||||
},
|
},
|
||||||
}
|
}
|
||||||
return caps.get(_clean_preview_backend(backend), {})
|
return caps.get(_clean_preview_backend(backend), {})
|
||||||
|
|||||||
@ -557,7 +557,7 @@ docker run -p 8880:8880 --gpus all \
|
|||||||
<span class="llm-metric-chip"><span class="mdi mdi-lightning-bolt"></span> ~0.5× GPU RTF</span>
|
<span class="llm-metric-chip"><span class="mdi mdi-lightning-bolt"></span> ~0.5× GPU RTF</span>
|
||||||
<span class="llm-metric-chip"><span class="mdi mdi-clock-outline"></span> 1–3 s</span>
|
<span class="llm-metric-chip"><span class="mdi mdi-clock-outline"></span> 1–3 s</span>
|
||||||
<span class="llm-metric-chip"><span class="mdi mdi-star-circle-outline"></span> High (WAV clone)</span>
|
<span class="llm-metric-chip"><span class="mdi mdi-star-circle-outline"></span> High (WAV clone)</span>
|
||||||
<span class="llm-metric-chip"><span class="mdi mdi-memory"></span> 3–4 GB VRAM</span>
|
<span class="llm-metric-chip"><span class="mdi mdi-memory"></span> ~5 GB</span>
|
||||||
</div>
|
</div>
|
||||||
<p class="llm-local-desc">Coqui XTTS — multilingual voice cloning from a 6-second sample. 17 languages. Compatible with this app’s voice library.</p>
|
<p class="llm-local-desc">Coqui XTTS — multilingual voice cloning from a 6-second sample. 17 languages. Compatible with this app’s voice library.</p>
|
||||||
<div class="llm-local-url">
|
<div class="llm-local-url">
|
||||||
|
|||||||
Loading…
Reference in New Issue
Block a user