Production-ready Modal deployment of Microsoft VibeVoice-ASR (9B). Multi-hour audio via VAD-aware chunking, cross-chunk speaker unification with CAM++, auto-batched multi-GPU inference. 15x realtime.
What is the JacobLinCool/modal-vibevoice GitHub project? Description: "Production-ready Modal deployment of Microsoft VibeVoice-ASR (9B). Multi-hour audio via VAD-aware chunking, cross-chunk speaker unification with CAM++, auto-batched multi-GPU inference. 15x realtime.". Written in Python. Explain what it does, its main use cases, key features, and who would benefit from using it.
Question is copied to clipboard — paste it after the AI opens.
Clone via HTTPS
Clone via SSH
Download ZIP
Download main.zipReport bugs or request features on the modal-vibevoice issue tracker:
Open GitHub Issues