GuíaDictado por vozProductividad20 de julio de 2026 · 8 min de lectura

Dictado por voz en Linux: lo que de verdad funciona

Linux nunca trajo una función de dictado pulida como Windows o Mac. Pero el mundo open source llenó el hueco en silencio. Esto es lo que de verdad funciona, cómo configurarlo y dónde todavía se ven las costuras.

The Linux penguin Tux with a microphone badge, voice typing on Linux

Imagen: Icons8

Si usas Linux, ya conoces la sensación. Llega la caja, la abres, y en vez de un mueble terminado encuentras una bolsa de piezas, un diagrama doblado en seis idiomas y dos tornillos de más que aparentemente no van en ningún lado. Se puede armar. Muchas veces queda mejor que la versión pre-armada cuando terminas. Pero nadie te entregó algo terminado. El dictado por voz en Linux es exactamente esa caja de mueble para armar.

El usuario de Windows presiona una tecla y habla. El de Mac activa un interruptor en Ajustes del Sistema y habla. El de Linux recibe la bolsa de piezas. La buena noticia, y la razón de este artículo, es que las piezas son reales, encajan, y el resultado puede rivalizar con las versiones pulidas. Solo tienes que saber cuáles tomar primero. Vamos a armarlo.

La verdad honesta: Linux no tiene Win+H

Digamos la parte incómoda sin rodeos, porque fingir lo contrario te hace perder el tiempo. Los escritorios Linux más comunes no traen una función de dictado de primer nivel para todo el sistema, como Windows trae Escritura por voz (Win + H) o macOS trae Dictado. Ni GNOME ni KDE Plasma te dan de fábrica un botón de micrófono que escriba texto limpio en cualquier campo. No hay un solo interruptor que activar.

Ese es el tornillo que falta. Todo lo demás en esta guía trata de las piezas que sí funcionan, para que no te quedes mirando un diagrama vacío. La respuesta de Linux no es un producto. Es un ensamblaje, y es uno bueno.

No esperes una función integrada

Existen herramientas de accesibilidad como el teclado en pantalla de GNOME y el lector Orca, pero ninguna es un motor de dictado general que escriba tu voz en tu editor. Si estás esperando un clon oficial de Win+H de parte de GNOME o KDE, vas a esperar un buen rato. Las herramientas de la comunidad de abajo son el camino real hoy.

Las piezas open source que sí encajan

Estas son las piezas que vale la pena tomar, más o menos en orden de qué tan rápido una persona normal las pone a funcionar. Cada una funciona de verdad sin conexión, que en Linux suele ser justo el punto.

Speech Note (dsnote): lo más cercano a fácil

Speech Note es una app de Flathub que funciona totalmente sin conexión y hace tanto voz a texto como texto a voz. Su gran ventaja es la elección de modelos: puede correr modelos Whisper y modelos Vosk de forma local, así que obtienes calidad de transcripción moderna sin enviar tu audio a ningún lado. Viene como una app gráfica normal, así que si quieres instalar una sola cosa, hacer un par de clics, descargar un modelo y empezar a dictar en su ventana, este es tu punto de partida menos doloroso. El costo es que es app-primero: dictas dentro de Speech Note y luego mueves el texto, en vez de hablarle directo a cualquier campo del sistema.

nerd-dictation: para todo el sistema, si usas X11

nerd-dictation es lo más cercano a "habla y escribe en lo que tenga el foco". Funciona sin conexión, está construido sobre el motor Vosk y simula pulsaciones de teclas mediante xdotool, lo que significa que está enfocado en X11. En una sesión Wayland (la de por defecto en GNOME moderno) vas a necesitar soluciones alternas o una ruta con XWayland, y ahí aparecen los dos tornillos de más. Se configura por línea de comandos y está pensado para ser modificable, así que premia a quien se siente cómodo en la terminal. Cuando funciona, es la experiencia de "dictado de verdad" más completa de la lista.

Herramientas con whisper.cpp: potencia en crudo

Whisper, de OpenAI, es la misma familia de modelos que impulsa a mucho del dictado moderno, y whisper.cpp es una implementación local rápida en C/C++ que lo corre en hardware común. No es una app de dictado por sí sola, es un motor, pero hay un ecosistema sano de scripts y pequeños front-ends de la comunidad que lo conectan a un atajo para que puedas grabar, transcribir y pegar. Si te gusta armar tus propias herramientas, esto te da la mejor calidad de transcripción con control local total. Cuenta con hacer algo de cableado tú mismo.

Talon: potente, con curva de aprendizaje

Talon es otro animal. Es un sistema avanzado de control por voz orientado a computación sin manos y accesibilidad: no solo dictado, sino comandos, control del cursor y flujos completos por voz. Es la opción más capaz de aquí y por la que juran muchas personas con lesiones por esfuerzo repetitivo o necesidades de accesibilidad. El costo es una curva de aprendizaje real. No estás haciendo un clic, estás aprendiendo un sistema. Si el dictado es un medio para controlar toda tu máquina por voz, Talon vale la subida.

Una configuración real: dictar con Speech Note en pocos minutos

Como Speech Note es el camino más rápido a tu primer dictado funcionando en Linux, aquí está el ensamblaje concreto. Esta es la versión que puedes terminar esta noche.

  1. Instala desde Flathub

    Si ya tienes Flatpak configurado (la mayoría de distros lo trae, o revisa flatpak.org para la configuración inicial), instala Speech Note desde su página de Flathub. En muchos escritorios también la encuentras en tu centro de software buscando "Speech Note".

  2. Descarga un modelo de voz a texto

    Abre la app, ve a su sección de Idiomas o modelos y descarga un modelo de voz a texto para tu idioma. Elige un modelo Whisper si quieres la mejor calidad, o un modelo Vosk más ligero si tu máquina es vieja. Todo corre localmente después de la descarga.

  3. Da acceso al micrófono y prueba

    Elige tu micrófono en la app, presiona el botón de grabar y di una frase de prueba. El texto aparece en la ventana de Speech Note. Confirma que el idioma coincide con lo que estás hablando antes de confiar en ello.

  4. Lleva el texto a donde lo necesitas

    Copia el texto transcrito y pégalo en tu editor, chat o campo del navegador. Este es el pero honesto: Speech Note transcribe primero en su propia ventana, así que hay un paso de copiar y pegar en vez de escribir directo en cualquier app.

  5. Opcional: asigna un atajo global

    Los usuarios avanzados asignan acciones de Speech Note o un interruptor de nerd-dictation a un atajo de teclado en los ajustes de su escritorio, para que el dictado empiece con una sola tecla. Esa mejora lo convierte de una ventana que visitas en algo más cercano a todo el sistema.

Elige el modelo según tu hardware

Los modelos Whisper dan puntuación notablemente más limpia y mejores nombres, pero los más grandes piden más CPU o una GPU. Si el dictado se siente lento, baja a un modelo Whisper más pequeño o a un modelo Vosk. Para escribir a diario, rápido y un poco tosco suele ganarle a preciso pero con retraso.

Los límites honestos (los dos tornillos de más)

Todo mueble para armar tiene sus partes incómodas. Aquí es donde el dictado en Linux todavía te pide algo, para que no te sorprenda después:

  • Fricción con Wayland. Las herramientas que escriben en cualquier ventana (como nerd-dictation vía xdotool) se construyeron alrededor de X11. En una sesión Wayland quizá necesites XWayland o configuración extra para que la inyección de teclas funcione.
  • La configuración corre por tu cuenta. No hay un interruptor de un clic para todo el sistema. Incluso la opción más fácil, Speech Note, implica instalar una app y descargar un modelo antes de decir una palabra.
  • App-primero contra todo el sistema. La herramienta más amigable (Speech Note) transcribe en su propia ventana; la más de sistema (nerd-dictation) es la más quisquillosa de instalar. Muchas veces cambias facilidad por alcance.
  • La puntuación y los nombres varían según el modelo. Los modelos Vosk ligeros tienden a saltarse la puntuación y a estropear nombres propios. Los modelos Whisper manejan ambos mucho mejor, pero cuestan más cómputo.
  • Tú le das mantenimiento. Las herramientas de la comunidad avanzan rápido y dependen de tu distro, tu tipo de sesión y tu stack de audio. Cuando algo se rompe tras una actualización, el arreglo suele ser tuyo.

¿Y Golem? (solo Windows y Mac)

Quizá viste mencionado a Golem como una herramienta de dictado por voz limpia y a nivel de sistema: captura a nivel del sistema operativo, corre Whisper (large-v3-turbo) de OpenAI con un pase de limpieza por LLM que agrega puntuación, admite vocabulario personalizado para nombres y términos técnicos, e incluso puede hablar en un idioma y escribir en otro. Todo eso suena pertinente aquí, así que seamos francos sobre el pero: Golem es solo para Windows y Mac. No corre en Linux. En tu máquina Linux simplemente no es una opción, y por más que lo quieras eso no cambia.

Donde sí se vuelve relevante es si vives en más de un sistema operativo. Muchos usuarios de Linux también tienen un portátil de trabajo con Windows, un Mac en casa o una partición con arranque dual. En esas máquinas sí tienes opciones reales: el Win+H integrado y el Dictado de Apple (gratis), Wispr Flow (alrededor de $15 al mes), Superwhisper (en el dispositivo, enfocado en Mac) y Golem (gratis para empezar, luego $3 al mes o $30 al año). Ten claros los límites de Golem antes de depender de él: necesita un inicio de sesión y conexión a internet porque la transcripción corre del lado del servidor, y solo funciona en Windows y Mac. Pero en Linux mismo, tus mejores apuestas son las herramientas open source de arriba, punto. Esto es un repaso, no un discurso de venta, y en Linux la respuesta honesta apunta a Speech Note, nerd-dictation, whisper.cpp y Talon.

Speech Note (dsnote)nerd-dictationTalon
Sin conexiónSí (dictado)
MotorWhisper o VoskVoskPropio + complementos
Escribe en cualquier appNo (ventana propia, luego pegas)Sí (foco en X11)
Dificultad de configuraciónBaja (app gráfica)Media (terminal, X11)Alta (aprender un sistema)
Ideal paraPrimer resultado más rápidoDictado en todo el sistemaControl por voz total / accesibilidad
CostoGratisGratisNivel gratuito disponible
Una mirada justa a los tres caminos de dictado más comunes en Linux. No hay un ganador único: elige según cuánta configuración quieras cambiar por alcance.

El panorama completo

El sueño detrás de todo esto es una sola idea: voz que escribe texto limpio en el campo donde esté tu cursor, sin importar la app. Es la misma meta ya sea que estés en Linux, Windows o Mac. Si quieres el concepto explicado a fondo, lee dictado por voz en cualquier app.

Preguntas frecuentes

Preguntas frecuentes

¿Linux tiene una función de dictado integrada como Win+H?

No. Los escritorios Linux comunes como GNOME y KDE no traen una función de dictado de primer nivel para todo el sistema comparable a la Escritura por voz de Windows o el Dictado de macOS. En su lugar instalas una herramienta de la comunidad.

¿Cuál es la herramienta de dictado más fácil para empezar en Linux?

Speech Note (dsnote) desde Flathub. Es una app gráfica que funciona sin conexión, te deja descargar modelos Whisper o Vosk y funciona tras unos clics. El pero es que transcribe en su propia ventana, así que copias y pegas el resultado.

¿Puedo dictar directo en cualquier aplicación, en todo el sistema?

Eso es lo que busca nerd-dictation, usando xdotool para escribir teclas en la ventana enfocada. Funciona mejor en X11. En Wayland quizá necesites XWayland o configuración extra para que inyecte las pulsaciones.

¿El dictado por voz en Linux funciona sin conexión?

Sí, y esa es una fortaleza real. Speech Note, nerd-dictation, las herramientas con whisper.cpp y Talon corren localmente, así que tu audio no tiene que salir de tu máquina.

¿Puedo usar Golem en Linux?

No. Golem es solo para Windows y Mac. En Linux, usa las herramientas open source de esta guía. Golem solo es relevante si además trabajas en una máquina con Windows o Mac.

¿Qué herramienta da la puntuación y los nombres más limpios?

Las opciones basadas en Whisper (Speech Note corriendo un modelo Whisper, o las herramientas con whisper.cpp) suelen producir puntuación más limpia y mejores nombres propios que los modelos Vosk ligeros. El costo es que los modelos Whisper más grandes piden más CPU o una GPU.

← Volver al blog