是否有办法同时运行多个客户端?

作者: Bryan-Orifice创建于 2025年9月6日更新于 2026年8月24日

我想尽可能减少延迟,并提高 RTX 5090 同时可支持的用户数。 该模型在 VRAM 中占用的空间几乎是 8 倍,但运行多个工作进程会大大延长生成时间,使其无法帮助我(至少我现在这样做的方式)。 我尝试了分块和流式传输,但生成的文本与实时播放时间已经接近 1:1,仅有一个用户。 Ai 建议我可能可以"导出到 TensorRT 并使用多个执行上下文",但无法确认 chatterbox 是否支持此操作,所以我没有继续尝试,因为我对此了解不多。 感谢您提供的伟大模型,它与 SOTA 的付费服务相匹敌。

内容来源: resemble-ai/chatterbox