como testar modelo de vídeo de ia antes de migrar em 2026: teste de 5 planos
trocar de modelo de vídeo por causa de um lançamento é o jeito mais rápido de quebrar o personagem. veja o protocolo de 5 planos, a nota às cegas e a conta de custo por take aprovado antes de migrar.

em 2026 sai modelo de vídeo novo quase todo mês: kling 3.0 ganhou a versão turbo em junho, a bytedance anunciou o seedance 2.5 com clipe de 30 segundos numa passada só, o veo 3.1 ganhou a versão lite, e a api do sora desliga em 24 de setembro. cada lançamento vem com demo bonita e a tentação de migrar o perfil inteiro no mesmo dia. o problema é que demo de lançamento mostra o melhor take de mil, e o seu influencer de ia precisa do take aprovado em duas ou três tentativas, todo dia, com o mesmo rosto. este guia é o protocolo que resolve isso: um teste padronizado de cinco planos que você roda em qualquer modelo novo antes de mover uma cena sequer, e que responde à única pergunta que importa: quanto custa o take aprovado no seu personagem.
por que não dá pra confiar na demo de lançamento?
porque a demo responde "o que esse modelo consegue fazer" e você precisa saber "o que ele faz com o meu personagem, no meu cenário, com o meu movimento". são perguntas diferentes. os próprios comparativos de 2026 admitem que não existe benchmark independente de consistência de personagem entre kling 3.0, seedance 2.x e veo 3.1: as afirmações de duração e de referências são declaradas pelo fornecedor, e o resultado muda conforme a interface que expõe o modelo, a região e o plano.
tem mais um detalhe que a demo esconde: o mesmo modelo se comporta diferente dependendo de onde você acessa. o seedance 2.0 na dreamina, na runway e num revendedor de api pode ter resolução, duração, moderação e custo diferentes, como já mostramos na tabela de preço por segundo de cada modelo. então o teste não é "kling contra veo", é "esta porta de entrada do kling contra esta porta de entrada do veo", com o seu personagem.
o que preparar antes de gerar o primeiro clipe?
o teste só é justo se todos os modelos recebem exatamente o mesmo material. monte um pacote-fonte único e use ele igual em todas as interfaces:
- vistas do personagem: frontal, três quartos, perfil e corpo inteiro, mesma iluminação, fundo neutro
- folha de expressões: neutro, sorriso, surpresa, fala
- figurino e acessórios em imagem separada, incluindo os detalhes que mais somem (brinco, óculos, corrente)
- uma folha do cenário fixo onde o personagem passa a maior parte dos vídeos
- descrição de identidade de 100 palavras, congelada, copiada igual em todo prompt
- lista do que não pode mudar: rosto, silhueta do cabelo, camadas da roupa, paleta, proporção do corpo
se você já seguiu o guia de consistência de rosto, esse pacote é o seu kit de identidade com duas adições: a folha de expressões e a lista de proibições. anote também qual controle cada plataforma aceita e a outra não. o veo 3.1, por exemplo, aceita até três imagens de referência no modo ingredientes; o kling aceita de uma a quatro no recurso de elementos; o seedance 2.5 promete até 50 entradas multimodais, mas isso é número de keynote e ainda sem validação externa. essa diferença de controle costuma decidir o resultado mais que o nome do modelo.

quais são os 5 planos do teste?
a ideia é subir uma escada de dificuldade de movimento. um close parado não prevê nada sobre uma cena de caminhada, e é na caminhada que o rosto derrete. os cinco planos, sempre com a mesma duração, a mesma proporção (9:16 se o seu perfil é vertical) e a mesma resolução em todos os modelos:
- retrato: personagem parado, piscando, respirando, sorriso leve. testa se o modelo herda a referência
- rotação: cabeça vira do perfil pra câmera. testa quanto o modelo inventa quando precisa completar o que não viu
- caminhada: três passos com câmera acompanhando de lado. testa proporção de corpo e estabilidade de figurino
- ação: pega um objeto do cenário e para numa pose. testa mão, oclusão e contato físico
- interação: entrega o objeto pra um segundo personagem. testa colisão de identidade, que é onde dois rostos parecidos viram um só
gere pelo menos quatro amostras de cada plano em cada modelo. são 20 gerações por modelo, e é aí que o teste custa dinheiro, por isso ele roda na configuração mais barata (720p, sem áudio nativo) e só sobe de resolução no vencedor. se o modelo tem multi-shot, rode o plano 5 também nesse modo, seguindo o que explicamos no guia de multi-shot, porque planos que saem da mesma geração tendem a segurar melhor a identidade.
como dar nota sem se enganar?
a parte que quase ninguém faz e que muda tudo: esconda o nome do modelo antes de avaliar. renomeie os arquivos com número aleatório e peça pra duas pessoas (você e alguém que conhece o personagem) pontuarem cada clipe. a grade que funciona soma 100:
- identidade do rosto: 25
- cabelo e figurino: 20
- proporção do corpo: 15
- estabilidade do quadro (sem tremor, sem derretimento): 15
- continuidade entre os planos: 15
- obediência ao prompt e à câmera: 10
e marque as falhas fatais à parte, porque elas zeram o clipe independente da nota: membro extra, troca de rosto, acessório que sumiu, dois personagens fundidos, ação ilegível. um modelo com média 78 e nenhuma falha fatal vale mais que um com média 85 e uma troca de rosto a cada cinco gerações, porque no dia a dia a falha fatal é o que você não percebe antes de publicar.
um alerta sobre fala: se o plano tem diálogo em português, não avalie a boca pelo áudio nativo. kling 3.0 e veo 3.1 geram áudio nativo, mas nenhum deles lista português entre os idiomas, então a fala em português continua passando pelo fluxo de voz separada e lipsync. teste o áudio nativo só pra som ambiente e efeito.

como calcular o custo por take aprovado?
a métrica final não é preço por segundo nem nota média, e sim custo por take aprovado: quanto você gastou, em crédito e em tempo, até ter um clipe que passaria no seu feed. a conta:
- some os segundos gerados em cada modelo, incluindo os descartados
- multiplique pelo preço por segundo da configuração que você usou
- divida pelo número de clipes que passaram na nota e sem falha fatal
- some o tempo de limpeza (regeração, corte, retoque) convertido em hora sua
é comum o modelo mais barato por segundo perder aqui, porque precisa de oito tentativas onde o outro precisa de três. e é comum o mais caro perder também, porque a qualidade extra não aparece em tela de celular a 9:16. o vencedor é o que entrega o menor custo por take aprovado nos planos 3, 4 e 5, que são os que aparecem no seu conteúdo real. se o modelo que você usa hoje ganha ou empata, não migre: um lançamento não é motivo pra mexer em fluxo que funciona. esse foi o ponto central do plano de migração do sora: troque por necessidade, com lote de teste, nunca por manchete.
dicas práticas pra rodar o teste sem estourar o orçamento
- rode tudo em 720p sem áudio e só gere em 1080p com áudio no modelo vencedor, na cena final
- teste um modelo por semana, não três de uma vez; a memória visual do personagem confunde quando você olha 60 clipes no mesmo dia
- uma ação por plano: "anda, vira, pega e entrega" são quatro planos, não um prompt
- coloque aparência nas referências e ação no prompt; texto descrevendo rosto é o que mais gera drift
- limite a rotação de câmera: giro grande obriga o modelo a inventar o lado que ele nunca viu
- guarde o pacote-fonte versionado fora da plataforma, pra repetir o mesmo teste no próximo lançamento
- anote a data e a interface de cada teste; o mesmo modelo muda de comportamento entre atualizações
- confira o rótulo do modelo na interface no dia da produção; "seedance" num app pode ser 2.0 e no outro 2.5
o teste inteiro leva uma tarde por modelo e economiza semanas de retrabalho. mas ele também mostra o custo escondido de trocar fornecedor a cada lançamento: você vira o integrador do próprio pipeline. plataforma que orquestra o modelo por baixo e guarda personagem, voz e cenário fixo do seu lado resolve isso por você. crie seu primeiro vídeo grátis na viral, sem cartão, em menos de 10 minutos, e compare o take que sai de lá com o vencedor do seu teste.
perguntas frequentes
preciso testar todos os modelos novos que saem? não. teste quando o modelo atual começar a exigir mais tentativas, quando ele anunciar desligamento (caso do sora) ou quando um lançamento resolver uma limitação concreta do seu fluxo, como duração ou referência de figurino.
quantas gerações são suficientes pra ter uma conclusão? quatro amostras por plano, cinco planos, dá 20 por modelo. menos que isso é sorte; mais que isso raramente muda o ranking.
o teste funciona pra personagem estilizado ou só realista? funciona pros dois, mas personagem de estilo anime ou cartoon precisa de referência de traço limpo e movimento contido. nenhum modelo de 2026 deve ser dado como "melhor pra anime" sem esse teste específico.
posso usar o resultado de um comparativo da internet no lugar do meu teste? como ponto de partida, sim; como decisão, não. comparativos de 2026 avaliam personagens genéricos e reconhecem que não há benchmark independente de consistência. o que decide é o seu personagem no seu movimento.
vale a pena migrar se o modelo novo ganhar por pouco? só se a diferença de custo por take aprovado pagar o retrabalho: regerar um lote de vídeos com a nova referência pra virar o novo padrão do feed, em vez de misturar os dois estilos. se a margem for pequena, fique onde está e teste a viral de graça como alternativa que não exige integração nenhuma.