OpenWhispr: IA open source para transcribir de voz a texto

Radios Libres - Monday, August 31, 2026

OpenWhispr, es una aplicación de código abierto, también es gratuita, que funciona instalada en tu computadora sin necesidad de tener conexión a Internet o compartir tus grabaciones con terceros. Al final de este manual también tienes un videotutorial.

¿Qué es y qué hace?

En términos generales OpenWhispr es un software de transcripción: le puedes dictar un mail en tu casilla de correo o una frase en tu procesador de texto. Toma notas de reuniones y las transcribe con modelos de inteligencia artificial de código abierto. Te permite chatear con IAs y, finalmente, pasar audios grabados a texto y luego puedes hacer un resumen de esa transcripción.

Lo mejor es que con OpenWhispr puedes elegir entre trabajar en la nube o con modelos locales que te permiten procesar datos offline y, así, cuidarlos sin tener que compartirlos con terceros. Por eso lo recomendamos para medios y organizaciones que trabajan con información sensible.

El software es multiplataforma, es decir, funciona sobre GNU/Linux, Windows y macOS. Como apostamos por el software libre, este tutorial describe su uso en GNU/Linux EterTICs (GET).

Pasos para la instalación

Ingresa a su página oficial https://openwhispr.com/es. En el menú superior, presiona el botón ‘Descargar’ en el extremo derecho. Para descargar el instalador puedes optar por crear una cuenta o presionar el enlace (en gris, casi imperceptible) de ‘Continuar sin cuenta’. En el caso de este tutorial estamos usando la versión 1.9.2.

  • Ventajas de trabajar con cuenta: guardar los parámetros de configuración y tu trabajo.
  • Ventajas de trabajar sin cuenta: privacidad, ya que no te identificas.

Sea la opción que elijas, aparecerá un botón para descargar el instalador adecuado para tu sistema operativo. En GNU/Linux te permite descargar en distintos formatos: AppImage, .deb, RPM y tar.gz. En Radios Libres probamos AppImage (casi 500 MB) en Mint y GNU/Etertics, y .deb en Debian y Mint, ambas funcionan perfecto.

Es probable que al descargar AppImage debas configurar el archivo para que sea ejecutable. Busca el instalador que acabas de descargar, haz clic derecho y selecciona ‘Propiedades’. En la pestaña ‘Permisos’, marca la opción ‘Permitir ejecutar el archivo como un programa’. Ahora ya puedes hacer doble clic e instalarlo como con cualquier otro programa. Si es .deb, seguramente tendrás instalado Gdebi o algún otro instalar de estos archivos.

Configuración

Tras la instalación, abre el programa, lo encontrarás en la sección ‘Accesorios’ de tu menú de aplicaciones. La primera vez recomendamos establecer la configuración inicial. Depende de las versiones y el sistema esta configuración puede variar en el orden o el número de pasos.

Puedes seguir sin crear una cuenta pero, ese ese caso, no podrás usar modelos en la nube que, sin pagar, tienen limitaciones. Al elegir cualquiera de las opciones estás aceptando los términos de servicio y la política de privacidad.

En las versiones anteriores a la 1.9.2 salía este paso, ahora ya no. Solicita un perfil general de uso, es decir, para qué vas a usar el programa. Elige una o dos de las seis opciones, algunas son muy específicas como la de diagnósticos y recetas médicas. Si tu Sistema Operativo está en castellano, ese debería ser el idioma de OpenWhispr. Si aparece en inglés, puedes ayudarte a traducir con https://deepl.org

Micrófono

Si vas a instalarlo en una computadora portátil con micrófono incorporado no vas a encontrar problemas en el proceso de configuración. Si, por el contrario, usas una PC de escritorio y no tienes un micrófono instalado (por ejemplo, si quieres usar OpenWhispr para transcribir audios y no para dictar) la configuración se frenará, al menos en nuestro caso. Si te sucede, deberás enchufar un micrófono (o un auricular) en la entrada correspondiente (la de la ficha rosada) para continuar.

Atajos de teclado y modo de dictado

En el paso tres deberás configurar los atajos de teclado para las diferentes funciones de dictado. Puedes dejar las que vienen configuradas por defecto y cambiarlas luego.

Importante: al elegir los atajos es conveniente buscar una combinación de teclas, ya que si elijes solo una (la barra espaciadora, por ejemplo), cada vez que la presiones -incluso con el programa cerrado- el sistema entenderá que quieres “dictar” y comenzará un proceso de transcripción. En este momento de la configuración inicial puedes probar la tecla clave (hot key) elegida.

A su vez, puedes configurar la opción ‘Pulsar’ para activar y desactivar la grabación, o ‘Mantener’ para grabar solo mientras tengas presionada la tecla. Esta última no me funcionó.

Modelo e idioma

Si elegiste trabajar sin registrarte, en este momento de pedirá también que selecciones el modelo de lenguaje con el que quieres trabajar que tendrás que descargar. Si te registraste, en este paso sólo te pedirá el idioma y podrás configurar el modelo más tarde.

Como verás, puedes elegir entre trabajar con un modelo en la nube (Cloud) o en tu computadora (Local).

Nube. La versión en línea tiene la ventaja de tener mayores prestaciones en su rendimiento inmediato (una transcripción más fiel), pero la versión gratuita tiene un límite de 2000 palabras semanales (muy poco si lo usas a diario). El desarrollador asegura que los datos (información y grabaciones) no son compartidos ni se usan para entrenar modelos. Pero si usas esta versión tus datos estarán en la nube y, por lo tanto, sujetos a cierta vulnerabilidad. No recomendamos esta opción con información sensible.

Local. En la versión local, además de trabajar sin conexión a internet, tienes la seguridad de estar trabajando en tu propia computadora. Para trabajar en local es necesario descargar algunos de los “modelos” que nos ofrece. Es decir, OpenWhispr es el programa pero necesita usar algún modelo de lenguaje para transcribir. Existen varias opciones.

  • Si no te registraste, te aparecerán los modelos abiertos de OpenIA y de NVIDIA.
  • Si te registraste, te aparecerán otros Llama de Meta, Gemma de Google, Groq, xAI, Nvidia, Mistral, Qwen, LiquidAI y OpenIA (desarrollador original de OpenWhispr). La clave es utilizar el modelo que mejor se adapte a tus necesidades y condiciones.

En la configuración, primero te solicita el modelo abierto que descargarás para el dictado. Posteriormente podrás descargar otros. Nos hemos decantado por el Nemotron Speech de 632 mb, un buen equilibrio en calidad y peso. También probamos para la conversión de voz a texto, los modelos Base (140 MB) y Small (456 MB) de OpenAI, con buenos resultados en ambos casos. Sorprende el buen desempeño para la formulación de frases y la buena colocación de signos de puntuación. Puede tener dificultades en la conversión de algunas palabras “raras” muy específicas o los nombres propios.

Y luego te pedirá el modelo para el Agente, con quien vas a chatear por si necesitas resumir las transcripciones o traducirlas, por ejemplo. Según el que elijas, pueden ir desde los 75MB hasta los 20GB, de acuerdo a lo que vayas a hacer. A mayor tamaño del modelo más exactitud en su trabajo y, en consecuencia, más de lentitud de procesamiento, sobre todo si no tienes un equipo muy potente.

Hemos probado el LFM2.5 de 380 Mb y es más que suficiente para tareas básicas. O los modelos abiertos de Gemma 3 1B, también es una opción equilibrada.

IMPORTANTE

Al abrir el programa, en Preferencias, asegúrate que tienes seleccionado el idioma en el que estarán las grabaciones y dictados.

¿Qué le falta?

Echamos de menos tener el audio y el texto en la misma pantalla, algo útil en caso de la transcripción de audios. Si estuviera esta función podrías ir escuchando y corrigiendo los errores que pudieran surgir en el proceso, o cuando hay una palabra puntual que en la transcripción no se comprende, poder volver al audio e identificar cuál es esa palabra.

También sería muy útil un buscador de palabras en cada texto transcrito que aparece en Notas. Para transcripciones más extensas sería bueno poder encontrar palabras concretas que puede ser necesario ubicar específicamente sin tener que utilizar el chatbot.

Videotutorial

Revisa el video para ver en vivo el funcionamiento de OpenWhispr.