Script em Python para transcrever áudios e vídeos usando o modelo Whisper, com guia passo a passo para configuração e uso no Windows.
O usuário pode clonar o repositório (git clone ) ou baixar o ZIP manualmente. Em seguida, seguir o README: nele estão os pré-requisitos (Python ≥3.10 e FFmpeg), o passo a passo para instalar e colocar o FFmpeg no PATH, além dos comandos pip necessários para instalar Whisper e Torch dentro de um ambiente virtual se desejado. Por fim, executar o script: depois que o FFmpeg e as dependências estão instalados, basta chamar python transcrever.py CAMINHO/DO/ARQUIVO, o que dispara a validação do arquivo, chama o Whisper e grava um .txt UTF-8 ao lado do original.
- Python 3.10 ou superior instalado.
- FFmpeg disponível no sistema.
- Abra o navegador e acesse: https://www.python.org/downloads/windows/.
- Clique em Download Python (última versão).
- Quando abrir a instalação, marque a opção “Add Python to PATH”.
- Clique em Install Now e aguarde até terminar.
-
Acesse o site oficial: https://ffmpeg.org/download.html.
-
Clique em Windows builds from gyan.dev (link confiável indicado pelo site).
-
Na página que abrir, baixe o arquivo chamado ffmpeg-release-essentials.zip.
-
Após o download, clique com o botão direito no arquivo e escolha Extrair tudo.
-
Uma pasta chamada
ffmpeg-...será criada (o nome pode variar um pouco). Renomeie essa pasta para apenas:ffmpeg -
Mova essa pasta para dentro do diretório principal do Windows. Normalmente:
C:\ffmpeg.
Depois de extrair a pasta ffmpeg para C:\ffmpeg, é preciso informar ao Windows onde o programa está. Isso é feito adicionando o caminho C:\ffmpeg\bin na configuração chamada Path.
-
Clique no botão Iniciar (canto inferior esquerdo da tela).
-
Digite
variáveis de ambiente.- Vai aparecer uma opção chamada Editar variáveis de ambiente do sistema.
- Clique nela.
-
Na janela que abrir, clique no botão Variáveis de Ambiente... (fica embaixo).
-
Agora veja duas seções:
- Variáveis de usuário (apenas para sua conta no computador)
- Variáveis do sistema (para todos os usuários)
Você pode usar qualquer uma, mas para simplificar, escolha Variáveis do sistema.
-
Nessa lista, encontre a variável chamada Path.
- Clique em Path.
- Depois clique em Editar....
-
Vai abrir uma janela com vários caminhos (linhas de texto).
- Não apague nada!
- Clique em Novo.
- Digite exatamente:
C:\ffmpeg\bin
-
Clique em OK em todas as janelas para salvar.
-
Abra o Prompt de Comando.
-
Vá até a pasta do projeto:
cd C:\Users\SEU_USUARIO\Desktop\transcricao -
Instale as dependências, um comando por vez:
pip install git+https://github.com/openai/whisper.git pip install torch
Após instalar o FFmpeg e as dependências:
-
Salve o arquivo de áudio ou vídeo em um dos formatos suportados (
.mp3,.mp4,.m4a,.wav,.flac,.ogg,.webm,.wma,.aac,.mov,.mkv). -
Execute o script
transcrever.py, informando o caminho do arquivo a ser processado:python transcrever.py /caminho/para/o/arquivo.mp3
Opcionalmente, você pode indicar um modelo específico do Whisper com a flag
--modelo(por exemplo,tiny,small,medium,large):python transcrever.py /caminho/para/o/arquivo.mp4 --modelo small
-
O script valida o caminho informado, verifica a extensão do arquivo e, em seguida, carrega o modelo com
whisper.load_modelpara executartranscribe. A transcrição é salva em um arquivo.txtcom o mesmo nome do arquivo original, codificado em UTF-8.
Caso ocorra algum erro (arquivo inexistente, extensão não suportada etc.), o script exibirá uma mensagem explicando o problema.