Нативное аудио с lip sync
Veo 3.1 генерирует аудио как полноценный output: диалоги в кавычках превращаются в речь, синхронизированную с движением губ (точность около 120 мс), описанные действия получают подходящие sound effects, а сцены — ambient soundscapes. Social clips и product demos можно выпускать без отдельного sound-design pass.