O que é o Dicta

Transcrição local de vídeos.

25 Jul 2026

Dicta é uma ferramenta local para transformar vídeos em texto. Ela extrai o áudio com FFmpeg, usa whisper.cpp para reconhecer a fala e entrega uma transcrição completa e uma legenda com tempos.

A ideia central

O vídeo fica no computador

O Dicta foi pensado para que o arquivo original, o áudio temporário e a transcrição permaneçam no computador do usuário. O programa não envia vídeos, áudios ou textos para uma API externa durante o processamento padrão.

O objetivo é simples: transformar um vídeo em texto sem transformar o arquivo pessoal em uma dependência de serviço online.

Como funciona

Um fluxo curto entre vídeo e texto

01. Entrada

Você escolhe um vídeo pelo terminal ou arrasta o arquivo para a janela gráfica.

02. Áudio

O FFmpeg extrai o áudio em mono, com a configuração necessária para a transcrição.

03. Transcrição

O whisper.cpp e um modelo Whisper reconhecem a fala no idioma escolhido.

04. Resultado

O Dicta cria um texto completo e um arquivo SRT com os tempos da fala.

Componentes

Peças simples, combinadas localmente

Python

Coordena o fluxo, os caminhos, o progresso, o cancelamento e os arquivos de saída.

FFmpeg

Converte o áudio do vídeo para um formato que o transcritor consegue processar.

whisper.cpp

Executa o reconhecimento de fala localmente, usando o modelo Whisper escolhido.

PySide6

Fornece a janela opcional para selecionar, arrastar, acompanhar e abrir a transcrição.

Resultado

Texto completo e legenda

Ao lado do vídeo, o Dicta cria uma pasta com o nome do arquivo e a palavra “transcrição”. Dentro dela ficam transcricao.txt, para leitura e edição, e transcricao.srt, para usar como legenda.