Cobertura ao vivo

Como a IA gera vídeos: difusão, transformers e o que vem por trás

Como a IA gera vídeos: difusão, transformers e o que vem por trás

Por trás de cada clipe criado por IA existe uma combinação de ideias de pesquisa. Entender, em linhas gerais, como a IA gera vídeos ajuda a escrever prompts melhores e a ter expectativas realistas.

Como a IA gera vídeos: difusão, transformers e o que vem por trás

Modelos de difusão

A maioria dos geradores parte de um ruído aleatório e o transforma, passo a passo, na imagem descrita pelo texto. Esse processo, chamado difusão, aprende a limpar o ruído até formar cada quadro.

O papel dos transformers

Para manter a coerência ao longo do tempo, os modelos usam transformers, a mesma família de arquitetura por trás dos modelos de linguagem. Eles ajudam a relacionar o texto com as imagens e a manter a consistência entre os quadros.

Por que vídeo é mais difícil que imagem

Um vídeo não é só uma sequência de fotos. Ele precisa de continuidade, física plausível e movimento estável. Manter um objeto igual de um quadro para o outro é um desafio grande, e é por isso que a consistência ainda falha às vezes.

O que esperar do futuro

Os modelos tendem a ganhar clipes mais longos, melhor controle e áudio cada vez mais integrado. Saber disso ajuda a entender por que certas cenas saem perfeitas e outras exigem várias tentativas.

Leia também