Transcritório
Transcreva entrevistas sem enviar seu áudio para a nuvem. Aplicativo desktop gratuito para transcrição automática e separação de falantes em português brasileiro.
- 100% local — o áudio nunca sai da sua máquina; compatível com LGPD e com qualquer TCLE razoável.
- Português brasileiro nativo — baseado no Whisper (modelo de transcrição de fala da OpenAI) treinado com ampla variação dialetal.
- Gratuito e código aberto — licença MIT, desenvolvido no IESP-UERJ / CERES. Sem assinatura, sem telemetria (o primeiro uso pede apenas uma conta gratuita da Hugging Face para baixar o modelo de separação de falantes).
Site do projeto: antrologos.github.io/Transcritorio (passo a passo com imagens)
Instalação
O Transcritório é instalado pelo uv, que baixa o Python e todas as dependências das fontes oficiais (Microsoft, PyPI, PyTorch). É uma vez só; no dia a dia você abre pelo atalho da área de trabalho.
Windows 10/11, sem terminal (recomendado) — baixe o instalador de um clique e clique duas vezes nele:
Ele faz sozinho os três comandos abaixo, mostra o progresso e abre o programa no final (se o Windows perguntar "Deseja executar este arquivo?", confirme — o script é auditável e só instala de fontes oficiais assinadas). Para atualizar depois: Atualizar-Transcritorio.bat.
Windows 10/11, pelo terminal — abra o Prompt de Comando (menu Iniciar → digite cmd → Enter) e cole os três comandos, um por vez:
winget install astral-sh.uv
winget install Gyan.FFmpeg
uv tool install --python 3.12 transcritorio
Feche e reabra o Prompt, digite transcritorio e pressione Enter. O programa abre e cria o atalho Transcritório na área de trabalho — a partir daí, é só clicar nele.
Guia detalhado com solução de problemas: docs/INSTALL_WINDOWS.md
macOS (beta) — no Terminal, com Homebrew:
brew install uv ffmpeg
uv tool install --python 3.12 transcritorio
Em Apple Silicon (M1/M2/M3/M4), use uv tool install --python 3.12 "transcritorio[mac]" para transcrever com aceleração Metal. Sem Gatekeeper: não há app para "autorizar". Guia: docs/MAC_INSTALL.md
Linux (beta) — no terminal:
curl -LsSf https://astral.sh/uv/install.sh | sh
sudo apt install ffmpeg # ou o gerenciador da sua distribuição
uv tool install --python 3.12 transcritorio
Guia: docs/LINUX_INSTALL.md
- Atualizar:
uv tool upgrade transcritorio(o app avisa quando há versão nova). - Reparar: menu Ajuda → Reparar instalação (não afeta projetos, áudios nem modelos).
- Aceleração NVIDIA (opcional, 3–9× mais rápido): menu Ferramentas → Instalar aceleração NVIDIA (CUDA)….
Por que não tem mais instalador
.exe? As versões em instalador (.exe/.dmg/AppImage) foram descontinuadas: sem assinatura digital paga, antivírus e SmartScreen bloqueavam a instalação para boa parte dos usuários. O formato atual usa apenas componentes assinados pelos distribuidores oficiais e elimina esses bloqueios. Histórico e downloads antigos:docs/LEGACY_STANDALONE.md.
Para pesquisadores
O que você consegue fazer
- Importar áudios e vídeos (MP3, WAV, M4A, MP4 e outros) — arraste para a janela, um arquivo ou uma pasta inteira.
- Transcrever em português brasileiro com alta acurácia (90–96% em áudios limpos), com dois motores locais: Whisper (nas variantes small a large-v3-turbo; o padrão em máquinas com GPU) e o Parakeet pt-BR "TAGARELA" (experimental; o padrão em máquinas sem placa de vídeo — 1 h de áudio em poucos minutos, só no processador). Ao transcrever, o app pergunta quantas pessoas falam — entrevista a dois ou grupo focal (funciona bem até 6–8 participantes). Gravações em 15 outros idiomas também transcrevem com tempos por palavra (16 pacotes de alinhamento, incluindo o português).
- Separar falantes automaticamente — e nomeá-los ouvindo amostras: o diálogo "De quem é esta voz?" toca trechos de cada voz para você dizer quem é. Vozes recorrentes do projeto (ex.: a sua) passam a ser reconhecidas automaticamente. Uma verificação acústica confere cada troca de falante e marca com 🔍 as trocas duvidosas, no ponto exato do áudio.
- Revisar no Estúdio com player sincronizado, forma de onda interativa, cores por falante e edição por bloco — o duplo clique numa palavra leva o áudio até ela. Painéis ajustáveis: recolha o vídeo, amplie os blocos, trabalhe do seu jeito.
- Analisar com AI local (✨ nada sai do seu computador): resumo com índice temático de cada entrevista, glossário de nomes do projeto com revisão de grafias (a AI encontra "Joao/João/Jono" e você decide, ocorrência por ocorrência, com a grafia certa editável), e "Perguntar às entrevistas" — uma pergunta em português, respondida com citações dos trechos.
- Exportar em DOCX, MD, SRT, VTT, CSV, TSV e formato NVivo (importa direto no NVivo, Atlas.ti, MAXQDA ou num script R/Python). A aba Documentos reúne tudo que o app produz, com data e botão de abrir.
- Tudo offline depois do download inicial dos modelos (uma única vez; o tamanho depende do perfil de instalação — ver abaixo).
Requisitos por tipo de instalação
O assistente de primeiro uso examina a sua máquina e sugere o perfil adequado — nada é imposto, e dá para mudar depois em Ferramentas → Gerenciar modelos…. Números medidos (disco = aplicativo + modelos; tempos em CPU de 8 núcleos — em 4 núcleos, conte aproximadamente o dobro):
| Perfil | O que faz | Máquina | Disco | 1 h de áudio |
|---|---|---|---|---|
| Essencial | Só transcrever (TAGARELA + small) |
2+ núcleos, 4 GB RAM | ~6 GB | poucos minutos (TAGARELA) |
| Padrão | + separar falantes + tempos por palavra | 4+ núcleos, 8 GB RAM | ~7,5 GB | transcrição em minutos; separação de falantes de ~7 a ~20 min por hora de áudio, conforme o processador — pode ficar para depois |
| Padrão + GPU | idem, com aceleração NVIDIA (large-v3-turbo) |
GPU NVIDIA 4 GB+ VRAM | ~10 GB | ~5–10 min |
| Completo | + análise com AI local (resumo, glossário, perguntar) | GPU NVIDIA 6 GB+ VRAM, 16 GB RAM | ~20 GB | ~5–10 min |
Máquina sem placa de vídeo? Desde a v0.2.2 o motor Parakeet pt-BR (TAGARELA) é o padrão nessas máquinas: transcreve de 13× a 25× mais rápido que o tempo real em CPU (1 h de áudio em poucos minutos; a velocidade varia com o áudio), com tempos por palavra nativos. É experimental e só transcreve português — o Whisper
smallacompanha como reserva para outros idiomas. Quem instalou antes recebe a oferta de troca na própria lista de arquivos; também dá para trocar clicando no selo Modelo da barra inferior. E a etapa demorada sem placa de vídeo passa a ser a separação de falantes (~7 a ~20 min por hora de áudio): ao transcrever, a caixa "Separar falantes agora" permite deixá-la para depois e já revisar o texto.
Primeiros passos
1. Instale e abra. Siga a seção Instalação acima (três comandos, uma vez). Depois, abra pelo atalho Transcritório da área de trabalho. No primeiro uso, um assistente em português prepara os modelos de IA — e pergunta se você quer a identificação de falantes (opcional).
2. Crie um projeto. Abra o Transcritório e vá em Projeto → Novo projeto… Dê um nome (ex.: tese-entrevistas-2026) e escolha uma pasta. O app cria uma estrutura .transcricao com áudios, transcrições e metadados lado a lado — fácil de fazer backup e arquivar.
3. Adicione os áudios ou vídeos. Clique em Adicionar mídia… (ou arraste arquivos para a janela). Ao transcrever, o app pergunta quantas pessoas falam (entrevista, grupo focal, número exato ou automático) — e Editar propriedades… permite ajustar por arquivo depois (idioma, falantes, rótulos).
4. Clique em Transcrever e revise. O botão Transcrever faz o fluxo completo: prepara o áudio, transcreve, separa os falantes e monta o texto editável. Ao final, o diálogo "De quem é esta voz?" toca uma amostra de cada voz para você nomeá-las — os nomes valem para a transcrição inteira. Tempos realistas para 1 hora de entrevista (ver a tabela de perfis acima): ~5–10 min com GPU NVIDIA ou Apple Silicon; poucos minutos mesmo sem GPU com o motor TAGARELA (o padrão nessas máquinas) — ou ~1–1,5 h se optar pelo Whisper em CPU (o dobro em máquina de 4 núcleos). Depois, dê duplo clique na entrevista para abrir a transcrição, ouvir o áudio sincronizado com o texto, ajustar trechos com a forma de onda e exportar. Guia visual completo no site do projeto.
Modelos de IA no primeiro uso: o Transcritório baixa os modelos do perfil escolhido uma única vez (~3,5 GB só para transcrever em máquina sem GPU — TAGARELA + small; ~5 GB somando identificação de falantes e tempos por palavra; ~3 GB só o modelo grande para GPU); depois roda offline. A identificação de falantes é opcional: quem quer apenas transcrever não precisa de cadastro algum. Quem a ativa é orientado pelo assistente a criar uma conta gratuita na Hugging Face, aceitar os termos do modelo pyannote e colar um token de leitura — tudo em português, e dá para ativar depois sem repetir as transcrições.
Privacidade e ética
- Processamento 100% local: o áudio da entrevista nunca é enviado a servidores externos.
- Sem coleta de dados, sem telemetria: nenhum dado sai do seu computador. O único cadastro externo é a conta gratuita da Hugging Face, usada apenas uma vez para baixar o modelo de separação de falantes.
- Código-fonte aberto sob licença MIT: auditável por qualquer pessoa, incluindo o setor de TI da sua instituição.
- Compatível com LGPD e TCLE: você mantém controle integral sobre o áudio do informante e pode demonstrar a cadeia de custódia dos dados.
Texto pronto para submissão ao CEP (copie e cole no seu projeto de pesquisa):
A transcrição e a separação automática de falantes dos áudios coletados nesta pesquisa serão realizadas por meio do software Transcritório (Barbosa, 2026), uma aplicação de desktop gratuita e de código aberto (licença MIT), desenvolvida no IESP-UERJ/CERES. Todo o processamento ocorre localmente na máquina do pesquisador, sem envio do material a servidores externos, em conformidade com a Lei nº 13.709/2018 (LGPD) e com o TCLE assinado pelos participantes. O software utiliza os modelos Whisper (Radford et al., 2022) para transcrição e pyannote.audio (Bredin et al., 2020) para separação de falantes, ambos executados offline.
Como citar
Barbosa, R. J. (2026). Transcritório: transcrição local de entrevistas em português brasileiro (v0.2.0) [Software]. IESP-UERJ/CERES. https://github.com/antrologos/Transcritorio
@software{barbosa2026transcritorio,
author = {Barbosa, Rog{\'e}rio Jer{\^o}nimo},
title = {Transcrit{\'o}rio: transcri{\c{c}}{\~a}o local de entrevistas em portugu{\^e}s brasileiro},
year = {2026},
version = {0.2.0},
publisher = {IESP-UERJ/CERES},
license = {MIT},
url = {https://github.com/antrologos/Transcritorio}
}
O GitHub também exibe o botão "Cite this repository" no menu lateral, com os mesmos dados em formato APA e BibTeX, lendo o arquivo CITATION.cff.
Modelos de IA utilizados:
- Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., & Sutskever, I. (2022). Robust speech recognition via large-scale weak supervision. arXiv. https://arxiv.org/abs/2212.04356
- Bredin, H., Yin, R., Coria, J. M., Gelly, G., Korshunov, P., Lavechin, M., Fustes, D., Titeux, H., Bouaziz, W., & Gill, M.-P. (2020). pyannote.audio: neural building blocks for speaker diarization. ICASSP 2020. https://arxiv.org/abs/1911.01255
Para desenvolvedores
Se você quer rodar do código-fonte, contribuir com pull requests ou auditar o pipeline:
- Setup de ambiente, CLI e primeiros commits:
docs/DEVELOPMENT.md - Arquitetura do pipeline e estrutura de arquivos:
docs/ARCHITECTURE.md - Histórico de experimentos e decisões de modelo (testes A/B, variants):
docs/EXPERIMENTS.md - Checklist pré-release (canal standalone legado):
docs/PACKAGING_CHECKLIST.md - Segurança de tokens:
docs/SEGURANCA_SEGREDOS.md - Instalação no macOS:
docs/MAC_INSTALL.md - Instalação no Linux:
docs/LINUX_INSTALL.md - Aceleração MLX no Apple Silicon:
docs/MLX_WHISPER_MACOS.md - Troubleshooting macOS/Linux:
docs/MAC_LINUX.md - Code signing no Windows (encerrado — canal standalone aposentado):
docs/WINDOWS_CODE_SIGNING.md
Estrutura do repositório
transcribe_pipeline/ pacote Python principal (GUI, CLI, runners, render)
scripts/ instaladores .bat de duplo clique + wrappers CMD/PS1 (dev)
packaging/ (LEGADO) spec do PyInstaller, Inno Setup, hooks
tests/ toy tests (isolados) e smoke tests
docs/ documentação completa
.github/workflows/ ci.yml (testes) e publish.yml (tag v* → PyPI);
release.yml é o build standalone LEGADO (manual)
Status
| Plataforma | Estado | Notas |
|---|---|---|
| Windows 10/11 | Suportada | CPU por padrão; aceleração NVIDIA opcional pelo extra [cuda] (menu do app). |
| Linux x64 | Beta | Mesmo canal uv tool install --python 3.12 transcritorio; CPU. |
| macOS (Apple Silicon) | Beta | uv tool install --python 3.12 "transcritorio[mac]" habilita a aceleração Metal (MLX). |
As versões em instalador (.exe/.dmg/AppImage) foram descontinuadas — ver docs/LEGACY_STANDALONE.md.
Histórico do desenvolvimento (era do app standalone): docs/STANDALONE_APP_ROADMAP.md.
Contribuir e reportar bugs
- Bugs e sugestões: GitHub Issues.
- Discussões de metodologia e uso em pesquisa qualitativa são bem-vindas no mesmo canal.
- Pull requests: siga o estilo do código existente; toy tests passando em Windows/Linux/macOS; sem refatoração além do escopo.
Licença e autoria
Software distribuído sob licença MIT (veja LICENSE).
Autor: Rogério Jerônimo Barbosa — IESP-UERJ / CERES — antrologos.github.io — ORCID 0000-0002-6796-4547.
Agradecimentos às bibliotecas e modelos sobre os quais este projeto se apoia: Whisper (OpenAI), WhisperX, faster-whisper/CTranslate2, mlx-whisper, pyannote.audio, Parakeet pt-BR (NVIDIA) via onnx-asr, Qwen (análise local), GLiNER (nomes), PyTorch, PySide6/Qt, FFmpeg e uv (Astral).
No canal atual, o ffmpeg/ffprobe vêm do gerenciador de pacotes do sistema (winget/brew/apt) — nada é embutido. Nas releases legadas em instalador, o ffmpeg/ffprobe embutidos eram builds GPL de terceiros (BtbN para Windows, evermeet.cx para macOS, johnvansickle.com para Linux); veja NOTICE para a lista de componentes dessas versões e seus termos.
Download files
Download the file for your platform. If you're not sure which to choose, learn more about installing packages.
Source Distribution
Built Distribution
Filter files by name, interpreter, ABI, and platform.
If you're not sure about the file name format, learn more about wheel file names.
Copy a direct link to the current filters
File details
Details for the file transcritorio-0.2.4.tar.gz.
File metadata
- Download URL: transcritorio-0.2.4.tar.gz
- Upload date:
- Size: 363.7 kB
- Tags: Source
- Uploaded using Trusted Publishing? Yes
- Uploaded via:
twine/7.0.0 CPython/3.13.14
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
f4f7229b8220700022c0d899ecd05ebb1d3e102ad0841b94907f8f0df1245fb3
|
|
| MD5 |
8a89bd9ccae802059c9a59ed2cfced2f
|
|
| BLAKE2b-256 |
4088ca623b7515ca826d29ebeb42c470e8bd95fbd2e4f8a107c8ed00b8d83fa3
|
Provenance
The following attestation bundles were made for transcritorio-0.2.4.tar.gz:
Publisher:
publish.yml on antrologos/Transcritorio
-
Statement:
-
Statement type:
https://in-toto.io/Statement/v1 -
Predicate type:
https://docs.pypi.org/attestations/publish/v1 -
Subject name:
transcritorio-0.2.4.tar.gz -
Subject digest:
f4f7229b8220700022c0d899ecd05ebb1d3e102ad0841b94907f8f0df1245fb3 - Sigstore transparency entry: 2690040096
- Sigstore integration time:
-
Permalink:
antrologos/Transcritorio@7468019a263d550027bcf8a9ab074a4620579441 -
Branch / Tag:
refs/tags/v0.2.4 - Owner: https://github.com/antrologos
-
Access:
public
-
Token Issuer:
https://token.actions.githubusercontent.com -
Runner Environment:
github-hosted -
Publication workflow:
publish.yml@7468019a263d550027bcf8a9ab074a4620579441 -
Trigger Event:
push
-
Statement type:
File details
Details for the file transcritorio-0.2.4-py3-none-any.whl.
File metadata
- Download URL: transcritorio-0.2.4-py3-none-any.whl
- Upload date:
- Size: 381.3 kB
- Tags: Python 3
- Uploaded using Trusted Publishing? Yes
- Uploaded via:
twine/7.0.0 CPython/3.13.14
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
77c3c3af1bb0766a63e756ffc96422837b00d8650164056bad86d14e595e2621
|
|
| MD5 |
a0077fa9370221e400ed3ebe9010a7eb
|
|
| BLAKE2b-256 |
ec34686895727339b3d722d190738e035ea40f41266ff28569c52120747a0c25
|
Provenance
The following attestation bundles were made for transcritorio-0.2.4-py3-none-any.whl:
Publisher:
publish.yml on antrologos/Transcritorio
-
Statement:
-
Statement type:
https://in-toto.io/Statement/v1 -
Predicate type:
https://docs.pypi.org/attestations/publish/v1 -
Subject name:
transcritorio-0.2.4-py3-none-any.whl -
Subject digest:
77c3c3af1bb0766a63e756ffc96422837b00d8650164056bad86d14e595e2621 - Sigstore transparency entry: 2690040141
- Sigstore integration time:
-
Permalink:
antrologos/Transcritorio@7468019a263d550027bcf8a9ab074a4620579441 -
Branch / Tag:
refs/tags/v0.2.4 - Owner: https://github.com/antrologos
-
Access:
public
-
Token Issuer:
https://token.actions.githubusercontent.com -
Runner Environment:
github-hosted -
Publication workflow:
publish.yml@7468019a263d550027bcf8a9ab074a4620579441 -
Trigger Event:
push
-
Statement type: