[New Model] PrismAudio (Video-to-Audio Generation)
#2,140 opened on Mar 24, 2026
Repository metrics
- Stars
- (4,990 stars)
- PR merge metrics
- (PR metrics pending)
Description
Model
PrismAudio — a video-to-audio generation framework from FunAudioLLM. Generates environment sounds and sound effects synchronized with video content (e.g. footsteps, rain, metal impacts). 518M parameters, generates 9s audio in 0.63s. Published at ICLR 2026.
Architecture
Diffusion-based model with decomposed chain-of-thought reasoning. Uses four reward models (semantic, temporal, aesthetic, spatial) for multi-objective optimization via reinforcement learning (Fast-GRPO).
Key components:
- Diffusion backbone for audio generation
- Chain-of-thought decomposition for multi-dimensional planning (semantic, temporal, aesthetic, spatial)
- Multi-reward RL training with Fast-GRPO for efficient optimization
Fit with vllm-omni
Single-stage diffusion pipeline, similar to Stable Audio and AudioX. Could reuse the existing diffusion infrastructure (DiffusionAttention, pipeline base classes).
References
- Project page: https://prismaudio-project.github.io/
- Paper: arXiv:2511.18833
- HuggingFace: https://huggingface.co/FunAudioLLM/PrismAudio
- ModelScope: https://www.modelscope.cn/models/iic/PrismAudio
- Demo: https://huggingface.co/spaces/FunAudioLLM/PrismAudio