WhisperGuíaDictado por voz15 de julio de 2026 · 7 min de lectura

Cómo usar Whisper de OpenAI sin programar

Whisper de OpenAI es uno de los mejores modelos de voz a texto que existen, y es completamente gratis y open source. El detalle: para usarlo de verdad casi siempre necesitas Python, ffmpeg, descargar el modelo y una GPU decente. Aquí te muestro cómo usar Whisper sin escribir una sola línea de código.

Person speaking into a laptop microphone while text appears on screen

Imagen: Unsplash

Si buscaste Whisper, el primer resultado casi siempre es la página del modelo en Hugging Face o el repo de OpenAI en GitHub. Ambos son excelentes, y ambos asumen en silencio que eres desarrollador. Esta guía es para todos los demás: gente que solo quiere hablar y obtener texto limpio, sin tocar una terminal.

¿Qué es Whisper de OpenAI?

Whisper es un modelo de voz a texto (reconocimiento automático del habla) creado por OpenAI y liberado como open source con una licencia permisiva. Transcribe audio a texto con una precisión notable en más de 90 idiomas, entiende bien los acentos e incluso puntúa. La variante más nueva, Whisper large-v3-turbo, mantiene casi toda esa precisión pero corre varias veces más rápido.

Como es open source, cualquiera puede descargar los pesos del modelo y correrlos gratis. Eso es genuinamente bueno. Y también es donde la mayoría se traba.

Por qué usar Whisper por tu cuenta es más difícil de lo que parece

El modelo es gratis, pero usarlo directamente pide bastante preparación técnica:

  • Instalar Python y un gestor de paquetes, y hacer pip install de la librería de Whisper y sus dependencias.
  • Instalar ffmpeg para poder decodificar tu audio.
  • Descargar los pesos del modelo, que pueden pesar varios gigas.
  • Idealmente tener una GPU. En el CPU de un portátil normal, la transcripción puede ir lenta.
  • Correr todo desde la línea de comandos y escribir algo de código para apuntarlo a tu archivo de audio.

El hueco real

Whisper transcribe un archivo de audio que ya tienes. Por sí solo no escucha tu micrófono ni escribe en la app donde estás trabajando. Ese último tramo es justo lo que la mayoría realmente quiere.

Tres formas de usar Whisper

Por tu cuentaAPI de OpenAIUna app como Golem
InstalaciónPython, ffmpeg, pesosAPI key + códigoInstalas y listo
HardwareGPU recomendadaNinguno (nube)Ninguno (nube)
¿Requiere programar?No
Escribe en cualquier appNoNo
Limpia el textoNoNo
CostoGratis (tu hardware)Pagas por minutoGratis para empezar
El mismo modelo por debajo, tres experiencias muy distintas.

1. Correrlo localmente por tu cuenta

Ideal si eres desarrollador, quieres control total y te mueves bien en una terminal. Ganas privacidad (el audio nunca sale de tu máquina) y cero costo por uso, a cambio de la instalación y, en hardware modesto, de la velocidad.

2. Llamar a la API de OpenAI

No necesitas GPU y es rápido, pero igual necesitas una API key, escribes código para enviar el audio y pagas por minuto. Perfecto para construir tu propio producto, excesivo para simplemente dictar un correo.

3. Usar una app ya hecha

Este es el camino sin código. Una app de escritorio envuelve Whisper por ti: presionas un atajo, hablas, y aparece texto limpio donde esté tu cursor. Sin Python, sin GPU, sin API keys. Esto es lo que casi todos buscan en realidad cuando buscan Whisper.

Usar Whisper por la vía fácil, con Golem

Golem es una app de dictado por voz para Windows y Mac construida sobre Whisper large-v3-turbo. Te da la calidad de Whisper sin nada de la instalación, y encima suma la parte que el modelo por sí solo no cubre: escribe en cualquier app y limpia lo que dijiste.

  1. Descarga e instala

    Consigue Golem para Windows o Mac. Sin terminal, sin dependencias que instalar a mano.

  2. Presiona tu atajo

    Un atajo de teclado activa Golem en la app donde estés: correo, Slack, Notion, el navegador, un editor de código.

  3. Solo habla

    Habla con naturalidad. Golem transcribe con Whisper, quita muletillas, puntúa y escribe el resultado donde está tu cursor.

  4. Refina por voz (opcional)

    Selecciona cualquier texto y dile a Golem qué hacer: hazlo más corto, más formal o tradúcelo. El modelo reescribe ahí mismo.

Dicho de otra forma: Whisper se encarga de la transcripción, y Golem se encarga de todo lo que la rodea y que hace que la voz sea de verdad útil en el día a día. Puedes empezar en el plan gratis, sin tarjeta.

¿Qué opción te conviene?

  • Eres desarrollador y quieres control local total y privacidad: córrelo por tu cuenta.
  • Estás construyendo software que necesita transcripción: la API de OpenAI.
  • Solo quieres hablar en vez de escribir, en todas partes, hoy: una app como Golem.

Preguntas frecuentes

¿Whisper de OpenAI es gratis?

Sí. El modelo Whisper es open source y gratis de descargar y correr. Solo pagas si usas un servicio de pago construido encima, como la API de OpenAI o un plan Pro en una app de terceros.

¿Puedo usar Whisper sin instalar Python?

Sí. No necesitas Python si usas una app que ya trae Whisper integrado, como Golem. Python solo hace falta si corres el modelo por tu cuenta desde el código fuente.

¿Necesito una GPU para usar Whisper?

Solo si corres el modelo localmente y quieres que sea rápido. Las apps y APIs que corren Whisper en la nube no necesitan ninguna GPU de tu lado.

¿Cuál es la diferencia entre Whisper y Whisper Turbo?

Whisper large-v3-turbo es una versión optimizada de Whisper large-v3 que corre varias veces más rápido manteniendo casi la misma precisión. Es el modelo que usa Golem.

← Volver al blog