← Todos os projetos
P.05 automação

Pipeline de Mídia Social com IA

De um tema a um vídeo vertical pronto e publicado: roteiro, narração com voz clonada, imagens, gráficos, legenda karaokê, mascote com sincronia labial e montagem — sem ninguém no meio.

Papel
Projeto próprio
Estágios
7, do tema à publicação
Tempo por vídeo
cerca de 30 minutos
Roda em
uma GPU de mesa

O problema

Produzir vídeo curto de educação financeira em ritmo diário é caro em duas moedas: horas de edição e chamadas de API. Os geradores prontos resolvem o volume e entregam o defeito no lugar — narração robótica e imagem que não conversa com o texto.

O projeto ataca os dois: troca a API paga de imagem por automação de navegador sobre uma assinatura que já existe, e trata narração e sincronia como problema de engenharia, não como sobra do processo.

O que faz

  • Escreve o roteiro segmentado a partir de um tema, com gancho, laço aberto, reganchos e chamada final.
  • Narra com marcação de tempo por palavra, em voz sintética de CPU ou na voz clonada do autor.
  • Gera as imagens verticais dirigindo um navegador já autenticado, sem custo de API por imagem.
  • Desenha os gráficos financeiros por código sempre que o roteiro pede um.
  • Monta a legenda karaokê palavra a palavra, aplica sincronia labial no mascote e fecha o arquivo final.
  • Publica sozinho, e uma falha no envio não derruba o resto do pipeline.

Como foi construído

Sete estágios sequenciais orquestrados por um único arquivo, com cada domínio isolado num módulo — roteiro, voz, imagem, legenda, mascote, montagem e publicação. Cada peça cara é trocável por variável de ambiente, o que permite rodar o mesmo pipeline num modo barato de CPU ou no modo completo com GPU.

Número nunca sai da IA de imagem

É a regra de ouro do projeto, e ela existe porque o modelo de imagem não desenha gráfico: sai rabisco, eixo sem valor, dígito quase certo. A solução inverte a responsabilidade — o roteirista emite os parâmetros do gráfico (tipo, título, rótulos, faixa do eixo) e é o código que desenha, substituindo a imagem daquele trecho. O mesmo vale para todo texto na tela, sobreposto por código.

Para um vídeo de educação financeira, um eixo alucinado não é defeito estético: é informação falsa publicada num canal público. A regra coloca cada elemento no mecanismo com a garantia certa — generativo onde errar é aceitável, na arte de fundo, e determinístico onde errar é inaceitável, nos números. O preço é liberdade visual: o gráfico vive numa faixa fixa do quadro, com paleta fixa, e o esquema precisa crescer a cada novo tipo de visualização — enquanto pedir o gráfico ao modelo seria uma linha de prompt.

Stack

Roteiro e voz

  • Python 3.12
  • LLM
  • Chatterbox
  • faster-whisper
  • Kokoro

Imagem

  • Playwright sobre CDP
  • rembg
  • matplotlib
  • OpenCV

Vídeo

  • ffmpeg
  • legenda .ass
  • MuseTalk
  • Ken Burns

Publicação

  • TikTok Content Posting API
  • Telegram

Números

~30 minde tema a arquivo final, ponta a ponta
50%desse tempo é só a sincronia labial
$0de custo de imagem na configuração atual
60faixas de música licenciadas para uso livre

Tempos medidos numa RTX 5060 Ti e registrados no relatório de desempenho de 13/07/2026. O custo de imagem é zero porque a geração usa uma assinatura já paga, dirigida pelo navegador; numa configuração anterior, por API, o vídeo saía a cerca de US$ 0,39 — quase tudo em imagem.

Telas

A saída deste projeto é vídeo, não tela. Um quadro representativo de uma peça publicada entra aqui assim que for escolhido.