Voz a texto (STT)#
Hay motores de voz a texto (STT) empaquetados en Debian... desde la era pre-IA:
- CMU Sphynx / PocketSphinx. La precisión está anticuada.
- Julius. Difícil de configurar en los escritorios modernos.
Las soluciones de la era de la IA:
Speech-to-text (STT) en un escritorio de Debian en 2026, tiene 2 rutas:
- procesamiento local (con enfoque privado, utiliza su hardware) o
- basado en la nube (requiere internet, generalmente más rápido/más preciso).
Motores:#
| Herramienta | Procesamiento | Privacidad | Precisión | Mejor para... |
|---|---|---|---|---|
| Whisper | Local | Alta | Excelente | Transcribir grabaciones/reuniones. |
| VOSK | Local | Alta | Buena | Mecanografía/dictado en tiempo real. |
| DeepSpeech | Local | Alta | Moderada | Sistemas viejos o casos de uso específicos. |
- Dictado en tiempo real: "Nerd Dictation" Si quieres hablar y ver el texto aparece en tu editor de texto (como LibreOffice o Gedit),
Nerd Dictation es la mejor herramienta ligera para Linux. Utiliza el motor VOSK.
¿Por qué es genial? No necesita una GPU y es muy rápido.
Instalación: Normalmente es un script Python que clonas de GitHub. Depende del pitón3-vosk.
Flujo de trabajo: Asignas un atajo del teclado para iniciar/parar el modo de escucha.
- Solución integrada GNOME: "Dictation" (Extension/App)
Si prefieres un GUI que se integra con tu escritorio:
Dictado (por ElioQoshi): Mira el centro de software GNOME o Flatpak.
Proporciona un simple botón "Grabar" que envía texto directamente a su portapapeles o ventana enfocada.
Amberol / NewsFlash / Decibels: Algunas de estas nuevas aplicaciones GTK4 están empezando a integrar características de transcripción usando Whisper en el fondo.
Modelos:#
| Familia del Modelo | Tipo de Licencia | Uso comercial | Restricción principal |
|---|---|---|---|
| Mistral | Apache 2.0 | Sí | Ninguna (muy permisiva). |
| Falcon (TII) | Apache 2.0 | Sí | Ninguna (muy permisiva). |
| Llama (Meta) | Personalizado (Pesos abiertos) | Sí (limitado) | 700M+ Los usuarios necesitan permiso. |
| Gemma (Google) | Personalizado | Sí | Se aplican restricciones de uso. |
| GPT-4/Gemini | Fuente cerrada | No (API solamente) | No posées el modelo. |
Ver también:#
- https://www.youtube.com/watch?v=Cw1SESc8sdA&t=53s
- https://www.youtube.com/watch?v=VDMbWUfHsbk
Cancelación de ruido:#
Los motores STT sufren con ruido de fondo o del ventilador. Para una mejor precisión, se recomienda instalar NoiseTorch o el plugin PipeWire Noise Suppression.
Caso relacionado: Procesamiento por lotes:#
El mejor en todo: OpenAI Whisper (Local)#
Whisper es actualmente el estándar de referencia para STT de código abierto. Funciona completamente en tu máquina.
Cómo conseguirlo: La forma más fácil de ejecutar en Debian es a través de pip o usando un cliente especializado como Whisper.cpp.
Requisitos: Una CPU decente o, idealmente, una GPU NVIDIA.
Instalación:
sudo apt install ffmpeg # Instala primero ffmpeg
pip install -U openai-whisper # Instala whisper
Uso: Proporcionas un archivo de audio, y escupe texto.
whisper recording.mp3 --model medium