O que dá pra medir numa gravação, e o que não dá
Não existe conta que saiba se um assunto vai interessar a alguém. Quem promete alcance está vendendo sorte com nome de tecnologia. O que dá pra medir — e medir bem — é outra coisa: se aquele pedaço de gravação tem FORMA de corte.
Um corte que funciona sozinho tem quatro propriedades observáveis. Ele abre sem depender do que veio antes; ele fecha uma ideia em vez de ser interrompido no meio; ele trata de um assunto só; e a fala nele tem energia e ritmo. Nada disso é opinião: as quatro coisas deixam marca no áudio e no texto do que foi dito.
É isso que um detector honesto faz. Ele não opina sobre alcance — não tem como. Ele responde “este trecho se sustenta como peça independente”, que é a parte do trabalho que dá pra automatizar, e é justamente a parte chata de fazer na mão numa gravação de uma hora.
A nota, parcela por parcela
A nota que aparece ao lado de cada trecho vai de 0 a 100 e é a soma de seis parcelas. Os pesos estão escritos no código e somam exatamente 1,00:
- Abertura — 30%. A maior parcela, e não por acaso: é a única que decide se alguém chega ao resto. Ela mede se a primeira frase se sustenta sozinha. Um trecho que começa em “e aí isso aqui” perde quase tudo aqui, porque “isso” aponta pra fora do corte.
- Entrega — 20%. A energia da fala no trecho, medida no áudio. Fala arrastada e fala apagada pontuam menos que fala com variação.
- Fecho — 16%. Se a ideia termina. Um trecho cortado no meio de uma frase, ou que termina em “e aí o que acontece é que…”, perde aqui.
- Um assunto só — 14%. Quanto o trecho fala de uma coisa do começo ao fim. Um corte que muda de assunto no meio é dois cortes ruins colados.
- Ritmo — 12%. Palavras por minuto. Tem uma faixa boa; acima e abaixo dela a nota cai.
- Ar parado — 8%. Quanto do trecho é silêncio que não faz trabalho nenhum. É a menor parcela porque é a mais fácil de consertar depois.
A abertura vale mais nos três primeiros segundos
Dentro da parcela de abertura existe um relógio. Uma pergunta feita em 1,2 segundo vale peso cheio; a mesma pergunta feita aos 3 segundos vale 0,45; aos 5 segundos, 0,12. Depois disso não conta.
A escolha de olhar até 5 segundos, e não até 3, é deliberada: a decisão de continuar assistindo acontece nos primeiros segundos, mas um gancho que chega no quarto não vale zero — vale pouco. Cortar em 3 seria fingir que existe uma parede onde existe uma ladeira.
E o que conta como abertura são nove famílias, cada uma com peso próprio: pergunta, curiosidade, contraste, alerta, lista, “você”, história, peso e chamada de atenção. Empilhar três não vale três vezes: a segunda vale 85% e a terceira 70%, e da quarta em diante 50%. Quem começa com “olha só, presta atenção, deixa eu te falar uma coisa” não abriu três vezes — abriu uma vez e enrolou duas.
O que é conta, o que é regra e o que é modelo
Chamar tudo de “IA” esconde exatamente a informação que importa: o quanto do resultado é verificável. Então, sem eufemismo, o que é cada peça:
- CONTA (objetivo, sem julgamento). O nível em LUFS e o pico real seguem a ITU-R BS.1770-4, a mesma norma que as plataformas usam. Silêncio, energia, duração de pausa e palavras por minuto saem do sinal. Dois programas honestos medindo o mesmo arquivo têm que dar o mesmo número.
- REGRA (heurística, escrita por gente). As nove famílias de abertura, a ladeira do relógio, os seis pesos, as paredes que separam respiração de ruído. São escolhas — defensáveis, medidas contra material real, e ainda assim escolhas. Onde há regra, há alguém que decidiu, e esse alguém pode estar errado.
- MODELO (rede neural). Três, e todos rodam no navegador: a transcrição (Whisper), o modelo de sentido que entende que “preço” e “cliente” falam de venda, e — quando o navegador tem uma embutida, como o Chrome no computador — uma IA de linguagem que só serve pra entender pedidos escritos que as regras não pegaram.
- HÍBRIDO. A escolha final. O sinal diz ONDE um corte pode começar (numa fronteira de palavra, num silêncio de verdade); a regra diz QUAL desses vale a pena; o modelo diz DO QUE aquilo fala. Cada camada faz o que sabe fazer.
Nenhum modelo escolhe o segundo do corte
Esta é a decisão de projeto que mais muda o resultado, e ela é fácil de explicar: pedir a um modelo de linguagem “me dê os tempos dos melhores trechos” devolve tempos que parecem certos e não são. O modelo não ouviu o áudio; ele viu texto. Os números que ele escreve são plausíveis, não medidos — e um corte 0,4 segundo adiantado corta a primeira sílaba.
Aqui o modelo nunca é perguntado sobre tempo. Ele é perguntado sobre significado — “esses dois trechos falam da mesma coisa?”, “este pedido é sobre vendas?” — e o tempo sai sempre do sinal e das fronteiras de palavra da transcrição.
O efeito prático: não existe corte que comece no meio de uma palavra por invenção do modelo, e a mesma gravação analisada duas vezes dá o mesmo resultado.
Dez cortes diferentes, não dez variações do mesmo
Um detector que só ordena por nota tem um defeito previsível: os dez melhores trechos costumam ser o mesmo momento com dez começos ligeiramente diferentes. A pessoa pede dez cortes e recebe um.
A seleção resolve isso escolhendo por valor E por diferença ao mesmo tempo: cada novo corte precisa valer a pena por si e ser diferente dos já escolhidos. Numa gravação de teste, a semelhança média entre os clipes escolhidos caiu de 0,70 para 0,18 com a mesma nota mínima.
Receitas: os mesmos números, explicados
Duração e ritmo de corte não são universais, e por isso existem seis perfis prontos, cada um mostrando por que os números dele são o que são:
- Corte de podcast — 45 s. O tamanho em que uma ideia completa cabe sem virar aula.
- Aula ou tutorial — 70 s, e PRESERVA a pausa depois do ponto final. Em conteúdo de ensino aquele silêncio é onde quem assiste processa; apertá-lo é atrapalhar.
- História ou caso — 55 s, com respiro na virada de assunto.
- Opinião forte — 30 s.
- Reels curto — 18 s, e aperta tudo: em 18 segundos não sobra espaço pra ar.
- Só cortar, não mexer — corta e não remove nada.
Limpar a gravação, e o volume que só aparece depois de postar
Achado o trecho, sobram cinco coisas que dá pra tirar, cada uma ligável separadamente: frases que a pessoa refez, palavras repetidas, muletas soltas, pausas mortas e a respiração antes de cada frase. Na dúvida a limpeza não mexe, e tudo é desfazível na linha do tempo.
E tem o problema que ninguém vê antes de publicar: as redes tocam tudo num volume padronizado e não SOBEM o que chega abaixo dele. Um vídeo gravado baixo soa normal no fone de quem gravou e sai mais baixo que o resto do feed depois de postado. A ferramenta mede pela mesma norma (LUFS), avisa, e corrige na exportação — com um ganho estático, o mesmo do começo ao fim, que não comprime nem muda a voz. Quando já existe um estalo perto do teto, ela sobe só o que cabe sem estourar e diz que parou por isso.
Num lote isso importa mais que num vídeo: doze gravações feitas em doze dias saem em doze volumes, e quem assiste ouve uma alta e a seguinte baixa. É um defeito que nenhum vídeo sozinho tem — o conjunto tem.
O que ele não consegue fazer
Um texto sobre método que só lista acertos não é sobre método, é anúncio. Então os limites, com todas as letras:
- Não sabe se o assunto interessa a alguém. Mede forma, não mérito — e nenhuma conta local sabe isso.
- Escolhe pelo que foi DITO. Uma reação engraçada sem fala não é detectada.
- Não monta camadas. B-roll, música e efeitos são trabalho de editor de timeline.
- Depende da transcrição. Áudio muito ruim degrada tudo o que vem depois.
- Os pesos são uma escolha. Eles foram medidos contra material real, mas outra pessoa razoável escolheria outros — e por isso a nota vem aberta, com o motivo escrito ao lado de cada corte.