Uma alternativa ao Descript para os clipes, não para a edição
O Descript é onde você corta um episódio cortando a transcrição dele. Este lê o episódio que você já cortou e diz quais quarenta segundos dele valem a pena postar — com a pontuação, os timecodes e as frases por trás de cada candidato.
Um é uma ferramenta mais ampla que o outro, e essa é a resposta
Os dois partem de uma transcrição, e a semelhança termina aí. O Descript é um editor: tudo o que você pode fazer com um vídeo está na mesa, e encontrar um clipe é só uma tarefa entre muitas. Este faz uma única coisa — lê uma gravação longa e devolve os trechos que sobrevivem a serem assistidos sozinhos.
O entregável é o episódio
Você está removendo dez minutos de divagação, encaixando B-roll, ajustando o áudio e exportando um vídeo pronto. Isso é uma edição, e uma edição pede um editor. Descript.
O episódio já existe, você quer os clipes
Ele está publicado, ou prestes a estar, e em algum lugar dentro de duas horas estão os quatro trechos que valem a pena postar. Isso é um problema de leitura antes de ser um problema de edição. Este aqui.
Na maioria das semanas, é os dois
Nessa ordem. Nada aqui lê um arquivo de projeto ou uma timeline — ele recebe o vídeo pronto, então entra depois da edição, não no lugar dela.
O que diferencia os dois, por escrito
Sem marcações e sem travessões: um sinal ao lado do produto de outra empresa é uma afirmação sobre um software que não rodamos aqui. Cada célula diz o que cada ferramenta faz, e você decide qual frase descreve a sua semana.
| What differs | InTheClips | Descript |
|---|---|---|
| A unidade de trabalho | Uma gravação longa entra, uma lista ranqueada de clipes candidatos sai. Não existe projeto para montar nem nada para organizar na timeline. | Um projeto que você monta. A transcrição é o documento, e apagar uma linha apaga o vídeo por baixo dela. |
| Quem encontra o momento | Uma leitura de descoberta lê a transcrição em janelas de trinta minutos, em paralelo, com três minutos de sobreposição, e então um juiz cego ranqueia os finalistas reunidos numa única escala. | Você, lendo. Ver tudo o que foi dito e escolher a partir disso é exatamente para o que serve um editor de texto para vídeo. |
| O que chega junto com um candidato | Quatro pontuações — hook, flow, value, travel —, os timecodes, e as frases que o tornaram um candidato, para você poder discordar do raciocínio, não só do resultado. | O trecho que você destacou, onde você o destacou. |
| Onde um corte cai | O modelo indica as palavras de abertura e fechamento, e os tempos são lidos a partir delas, então um limite pode cair em qualquer lugar, menos no meio de uma palavra. | Onde você colocar, palavra por palavra, manualmente. |
| O que você pode mudar depois | Os pontos de entrada e saída, e uma lista de silêncios e hesitações que ele propõe remover, marcados um a um. Nada além disso — isto não é um editor. | Qualquer coisa. É esse o ponto dele. |
| O que sai no final | Um MP4 na biblioteca: caixa 1:1 com as palavras compostas atrás de quem fala, ou 9:16 em tela cheia com legendas palavra por palavra. | O que você exportar da sequência que montou, no formato que configurou. |
Their column is from Descript’s own public description of the product, read on ; ours is from the code that runs this one.
Do que consiste ler um episódio de duas horas
Como ele escolheA checagem que você não consegue fazer na própria edição
Um leitor a frio recebe só o clipe, e nada além disso. Depois que um momento é cortado, uma segunda leitura recebe só as falas do próprio clipe — sem transcrição ao redor, sem título, sem timecodes — e responde como alguém que acabou de cair ali. Se não conseguir acompanhar, o relatório volta para o corte e os limites são escolhidos de novo, até duas vezes. Um clipe que ainda assim não se sustenta sozinho fica na lista com a pontuação limitada a 60 e uma linha dizendo o que está faltando.
É a única leitura da qual você está desqualificado. Você sabe quem é o convidado e o que foi dito nos dez minutos anteriores, então, numa timeline, todo clipe que você corta faz sentido para você. É por isso que um clipe que começa com “bom, como você disse ali” é pego aqui, e não já exportado.
Uma edição é feita para você, e é pequena. Um momento pode ser montado a partir de até três partes em ordem cronológica — a introdução de um minuto antes, o momento em si, e o desvio entre eles descartado. As lacunas são preenchidas pela API no momento da renderização, e nunca vêm do cliente, então o clipe que é cortado é o mesmo que foi checado.
Leia um episódio longo dessa formaOnde este aqui para
Uma alternativa ao Descript que insinuasse, discretamente, que também pode gravar, editar e exportar seu episódio seria desmascarada no primeiro dia. Então aqui está o limite, por escrito.
Não existe timeline
Sem trilhas, sem B-roll, sem multitrack, sem gravação, sem transições. Mover os pontos de entrada e saída de um momento é todo o controle manual que existe, de propósito.
Ele não gera nada
Sem voz sintética, sem vídeo gerado, sem reescrever o que você disse. Toda palavra num clipe é uma palavra que você realmente falou, no momento em que falou.
Um vídeo de cada vez
Um catálogo antigo passa por ele um arquivo de cada vez. Não existe um lote que engole cem episódios da noite para o dia.
Uma combinação não existe
O texto atrás de quem fala foi desenhado para a caixa quadrada, então 9:16 com texto atrás não existe. O painel de opções corrige a combinação em vez de deixar um job falhar vinte minutos depois de iniciado.
Questions
Perguntas de quem já está com o Descript aberto em outra aba.
Isto substitui o Descript?
Não, se o entregável é o episódio. Não existe timeline aqui, nem multitrack, nem gravação, então qualquer coisa que termine com você exportando um vídeo longo pronto ainda pede um editor. O que ele substitui é a parte da semana gasta vasculhando um episódio pronto atrás dos quarenta segundos que valem a pena postar.
Posso corrigir um momento que ele acertou quase certo?
Você pode mover os pontos de entrada e saída. Arrastar uma alça também transforma o clipe de volta num trecho contínuo: as partes montadas são descartadas, porque foram avaliadas dentro de uma janela que não existe mais, e mantê-las tiraria segundos que ninguém conseguiria explicar depois.
Ele remove vícios de linguagem como o Descript faz?
Silêncios e sons de hesitação não lexicais — uh, um, er, hm — são calculados a partir dos tempos das palavras antes de qualquer vídeo ser tocado, listados um a um com o que seria removido, e só são de fato removidos os que você deixar marcados. Palavras com significado, como “então” ou “né”, nunca entram nessa lista: cortar uma delas pode quebrar a frase ao redor.
O que eu forneço a ele?
Um vídeo pronto, e há dois caminhos para entregá-lo. Envie o arquivo — mp4, mov, mkv ou webm — ou cole um endereço do YouTube, que é lido do nosso lado sem que nenhuma cópia do vídeo fique guardada — a transcrição pega só a faixa de áudio, e cada renderização depois busca apenas os segundos da própria janela, de modo que uma gravação longa nunca é baixada só para ser enviada de novo. Os links são só do YouTube e contados por dia — três no free trial, cem no Studio —, enquanto os uploads não são contados. Nenhum plano pago limita a duração de um único vídeo; o free trial é limitado pelos seus trinta créditos, que são trinta minutos de vídeo.
Como é cobrado, se os clipes são ilimitados?
Por minutos de vídeo de origem analisados. A transcrição e a leitura de seleção custam proporcionalmente à duração do vídeo; a renderização não, porque ela só toca nos segundos que você aprovou. Então as horas são o medidor, e os clipes que saem delas não são contados.
Qual é a aparência do clipe pronto?
Cinco formatos de saída, não dois. Caixa 1:1, com o texto composto atrás de quem fala, recortado por matte e posicionado sobre as palavras, ou 9:16 em tela cheia, com legendas palavra por palavra sincronizadas com a transcrição — nos dois, o enquadramento segue quem está realmente falando. Bolha de câmera (Cam bubble) e câmera sobre a tela (Face over screen) entram quando a análise encontra uma câmera separada na gravação; a imagem inteira (The whole picture) entrega a fonte inteira dentro de um quadro vertical, sem recorte. A proteção contra banner só entra em ação quando detecta um terço inferior já embutido na gravação.
As outras ferramentas de onde as pessoas vêm
Mesma estrutura, ponto de partida diferente — e, para quem está pesando o preço anual em vez da ferramenta, quanto vale de verdade um desconto aqui.

