Skip to content

Voz a texto (STT)#

Hay motores de voz a texto (STT) empaquetados en Debian... desde la era pre-IA:

  • CMU Sphynx / PocketSphinx. La precisión está anticuada.
  • Julius. Difícil de configurar en los escritorios modernos.

Las soluciones de la era de la IA:

Speech-to-text (STT) en un escritorio de Debian en 2026, tiene 2 rutas:

  • procesamiento local (con enfoque privado, utiliza su hardware) o
  • basado en la nube (requiere internet, generalmente más rápido/más preciso).

Motores:#

Herramienta Procesamiento Privacidad Precisión Mejor para...
Whisper Local Alta Excelente Transcribir grabaciones/reuniones.
VOSK Local Alta Buena Mecanografía/dictado en tiempo real.
DeepSpeech Local Alta Moderada Sistemas viejos o casos de uso específicos.
  1. Dictado en tiempo real: "Nerd Dictation" Si quieres hablar y ver el texto aparece en tu editor de texto (como LibreOffice o Gedit),

Nerd Dictation es la mejor herramienta ligera para Linux. Utiliza el motor VOSK.

¿Por qué es genial? No necesita una GPU y es muy rápido.

Instalación: Normalmente es un script Python que clonas de GitHub. Depende del pitón3-vosk.

Flujo de trabajo: Asignas un atajo del teclado para iniciar/parar el modo de escucha.
  1. Solución integrada GNOME: "Dictation" (Extension/App)

Si prefieres un GUI que se integra con tu escritorio:

Dictado (por ElioQoshi): Mira el centro de software GNOME o Flatpak.
Proporciona un simple botón "Grabar" que envía texto directamente a su portapapeles o ventana enfocada.

Amberol / NewsFlash / Decibels: Algunas de estas nuevas aplicaciones GTK4 están empezando a integrar características de transcripción usando Whisper en el fondo.

Modelos:#

Familia del Modelo Tipo de Licencia Uso comercial Restricción principal
Mistral Apache 2.0 Sí Ninguna (muy permisiva).
Falcon (TII) Apache 2.0 Sí Ninguna (muy permisiva).
Llama (Meta) Personalizado (Pesos abiertos) Sí (limitado) 700M+ Los usuarios necesitan permiso.
Gemma (Google) Personalizado Sí Se aplican restricciones de uso.
GPT-4/Gemini Fuente cerrada No (API solamente) No posées el modelo.

Ver también:#

  • https://www.youtube.com/watch?v=Cw1SESc8sdA&t=53s
  • https://www.youtube.com/watch?v=VDMbWUfHsbk

Cancelación de ruido:#

Los motores STT sufren con ruido de fondo o del ventilador. Para una mejor precisión, se recomienda instalar NoiseTorch o el plugin PipeWire Noise Suppression.

Caso relacionado: Procesamiento por lotes:#

El mejor en todo: OpenAI Whisper (Local)#

Whisper es actualmente el estándar de referencia para STT de código abierto. Funciona completamente en tu máquina.

Cómo conseguirlo: La forma más fácil de ejecutar en Debian es a través de pip o usando un cliente especializado como Whisper.cpp.

Requisitos: Una CPU decente o, idealmente, una GPU NVIDIA.

Instalación:

sudo apt install ffmpeg                      # Instala primero ffmpeg
pip install -U openai-whisper                # Instala whisper

Uso: Proporcionas un archivo de audio, y escupe texto. whisper recording.mp3 --model medium