Dicta é uma ferramenta local para transformar vídeos em texto. Ela extrai o áudio com FFmpeg, usa whisper.cpp para reconhecer a fala e entrega uma transcrição completa e uma legenda com tempos.
A ideia central
O vídeo fica no computador
O Dicta foi pensado para que o arquivo original, o áudio temporário e a transcrição permaneçam no computador do usuário. O programa não envia vídeos, áudios ou textos para uma API externa durante o processamento padrão.
O objetivo é simples: transformar um vídeo em texto sem transformar o arquivo pessoal em uma dependência de serviço online.
Como funciona
Um fluxo curto entre vídeo e texto
01. Entrada
Você escolhe um vídeo pelo terminal ou arrasta o arquivo para a janela gráfica.
02. Áudio
O FFmpeg extrai o áudio em mono, com a configuração necessária para a transcrição.
03. Transcrição
O whisper.cpp e um modelo Whisper reconhecem a fala no idioma escolhido.
04. Resultado
O Dicta cria um texto completo e um arquivo SRT com os tempos da fala.
Componentes
Peças simples, combinadas localmente
Python
Coordena o fluxo, os caminhos, o progresso, o cancelamento e os arquivos de saída.
FFmpeg
Converte o áudio do vídeo para um formato que o transcritor consegue processar.
whisper.cpp
Executa o reconhecimento de fala localmente, usando o modelo Whisper escolhido.
PySide6
Fornece a janela opcional para selecionar, arrastar, acompanhar e abrir a transcrição.
Resultado
Texto completo e legenda
Ao lado do vídeo, o Dicta cria uma pasta com o nome do arquivo e a palavra “transcrição”.
Dentro dela ficam transcricao.txt, para leitura e edição, e
transcricao.srt, para usar como legenda.