OpenWhispr: IA open source para transcribir de voz a texto
OpenWhispr es una aplicación de código abierto, también es gratuita, que
funciona instalada en tu computadora sin necesidad de tener conexión a Internet
o compartir tus grabaciones con terceros. Al final de este manual también tienes
un videotutorial.
¿QUÉ ES Y QUÉ HACE?
En términos generales OpenWhispr es un software de transcripción: le puedes
dictar un mail en tu casilla de correo o una frase en tu procesador de texto.
Toma notas de reuniones y las transcribe con modelos de inteligencia artificial
de código abierto. Te permite chatear con IAs y, finalmente, pasar audios
grabados a texto y luego puedes hacer un resumen de esa transcripción.
Lo mejor es que con OpenWhispr puedes elegir entre trabajar en la nube o con
modelos locales que te permiten procesar datos offline y, así, cuidarlos sin
tener que compartirlos con terceros. Por eso lo recomendamos para medios y
organizaciones que trabajan con información sensible.
El software es multiplataforma, es decir, funciona sobre GNU/Linux, Windows y
macOS. Como apostamos por el software libre, este tutorial describe su uso en
GNU/Linux EterTICs (GET).
PASOS PARA LA INSTALACIÓN
Ingresa a su página oficial https://openwhispr.com/es. En el menú superior,
presiona el botón ‘Descargar’ en el extremo derecho. Para descargar el
instalador puedes optar por crear una cuenta o presionar el enlace (en gris,
casi imperceptible) de ‘Continuar sin cuenta’. En el caso de este tutorial
estamos usando la versión 1.9.2.
* Ventajas de trabajar con cuenta: guardar los parámetros de configuración y tu
trabajo.
* Ventajas de trabajar sin cuenta: privacidad, ya que no te identificas.
Sea la opción que elijas, aparecerá un botón para descargar el instalador
adecuado para tu sistema operativo. En GNU/Linux te permite descargar en
distintos formatos: AppImage, .deb, RPM y tar.gz. En Radios Libres probamos
AppImage (casi 500 MB) en Mint y GNU/Etertics, y .deb en Debian y Mint, ambas
funcionan perfecto.
Es probable que al descargar AppImage debas configurar el archivo para que sea
ejecutable. Busca el instalador que acabas de descargar, haz clic derecho y
selecciona ‘Propiedades’. En la pestaña ‘Permisos’, marca la opción ‘Permitir
ejecutar el archivo como un programa’. Ahora ya puedes hacer doble clic e
instalarlo como con cualquier otro programa. Si es .deb, seguramente tendrás
instalado Gdebi o algún otro instalar de estos archivos.
CONFIGURACIÓN
Tras la instalación, abre el programa, lo encontrarás en la sección ‘Accesorios’
de tu menú de aplicaciones. La primera vez recomendamos establecer la
configuración inicial. Depende de las versiones y el sistema esta configuración
puede variar en el orden o el número de pasos.
Puedes seguir sin crear una cuenta pero, ese ese caso, no podrás usar modelos en
la nube que, sin pagar, tienen limitaciones. Al elegir cualquiera de las
opciones estás aceptando los términos de servicio y la política de privacidad.
En las versiones anteriores a la 1.9.2 salía este paso, ahora ya no. Solicita un
perfil general de uso, es decir, para qué vas a usar el programa. Elige una o
dos de las seis opciones, algunas son muy específicas como la de diagnósticos y
recetas médicas. Si tu Sistema Operativo está en castellano, ese debería ser el
idioma de OpenWhispr. Si aparece en inglés, puedes ayudarte a traducir con
https://deepl.org
MICRÓFONO
Si vas a instalarlo en una computadora portátil con micrófono incorporado no vas
a encontrar problemas en el proceso de configuración. Si, por el contrario, usas
una PC de escritorio y no tienes un micrófono instalado (por ejemplo, si quieres
usar OpenWhispr para transcribir audios y no para dictar) la configuración se
frenará, al menos en nuestro caso. Si te sucede, deberás enchufar un micrófono
(o un auricular) en la entrada correspondiente (la de la ficha rosada) para
continuar.
ATAJOS DE TECLADO Y MODO DE DICTADO
En el paso tres deberás configurar los atajos de teclado para las diferentes
funciones de dictado. Puedes dejar las que vienen configuradas por defecto y
cambiarlas luego.
Importante: al elegir los atajos es conveniente buscar una combinación de
teclas, ya que si elijes solo una (la barra espaciadora, por ejemplo), cada vez
que la presiones -incluso con el programa cerrado- el sistema entenderá que
quieres “dictar” y comenzará un proceso de transcripción. En este momento de la
configuración inicial puedes probar la tecla clave (hot key) elegida.
A su vez, puedes configurar la opción ‘Pulsar’ para activar y desactivar la
grabación, o ‘Mantener’ para grabar solo mientras tengas presionada la tecla.
MODELO E IDIOMA
Si elegiste trabajar sin registrarte, en este momento te pedirá también que
selecciones el modelo de lenguaje con el que quieres trabajar, y que tendrás que
descargarlo. Si te registraste, en este paso sólo te pedirá el idioma y podrás
configurar el modelo más tarde.
Como verás, puedes elegir entre trabajar con un modelo en la nube (Cloud) o en
tu computadora (Local).
Nube. La versión en línea tiene la ventaja de tener mayores prestaciones en su
rendimiento inmediato (una transcripción más fiel), pero la versión gratuita
tiene un límite de 2000 palabras semanales (muy poco si lo usas a diario). El
desarrollador asegura que los datos (información y grabaciones) no son
compartidos ni se usan para entrenar modelos. Pero si usas esta versión tus
datos estarán en la nube y, por lo tanto, sujetos a cierta vulnerabilidad. No
recomendamos esta opción con información sensible.
Local. En la versión local, además de trabajar sin conexión a internet, tienes
la seguridad de estar trabajando en tu propia computadora. Para trabajar en
local es necesario descargar algunos de los “modelos” que nos ofrece. Es decir,
OpenWhispr es el programa pero necesita usar algún modelo de lenguaje para
transcribir. Existen varias opciones para cada una de las dos modelos
necesarios:
* Para la conversión de voz a texto (dictado, grabación de notas y subir
audios) te aparecerán los modelos abiertos de OpenIA y de NVIDIA.
* Para los modelos de lenguaje (limpieza de dictado, asistente de voz y chat,
entre otras) te aparecerán modelos de Llama de Meta, Gemma de Google, Groq,
xAI, Nvidia, Mistral, Qwen, LiquidAI y OpenIA (desarrollador original de
OpenWhispr). La clave es utilizar el modelo que mejor se adapte a tus
necesidades y condiciones.
En la configuración, primero te solicita el modelo abierto que descargarás para
el dictado. Posteriormente podrás descargar otros. Nos hemos decantado por el
Nemotron Speech de Nvidia, de 632 MB, un buen equilibrio en calidad y peso.
También probamos para la conversión de voz a texto, los modelos Base (140 MB) y
Small (456 MB) de OpenAI, con buenos resultados en ambos casos. Sorprende el
buen desempeño para la formulación de frases y la buena colocación de signos de
puntuación. Puede tener dificultades en la conversión de algunas palabras
“raras” muy específicas o los nombres propios. Recuerda indicar en la
configuración el idioma de entrada, es decir, si el audio que subas o el dictado
estarán en castellano/español u otro idioma.
Y luego te pedirá el modelo para el agente, con quien vas a chatear por si
necesitas resumir las transcripciones o traducirlas, por ejemplo. Según el que
elijas, pueden ir desde los 250 MB hasta los 20 GB, de acuerdo a lo que vayas a
hacer. A mayor tamaño del modelo más exactitud en su trabajo y, en consecuencia,
más de lentitud de procesamiento, sobre todo si no tienes un equipo muy potente.
Hemos probado el LFM2.5 de LiquidAI, de 380 MB y es más que suficiente para
tareas básicas. O los modelos abiertos de Gemma 3 1B, también es una opción
equilibrada.
IMPORTANTE
Al abrir el programa, en Preferencias, asegúrate que tienes seleccionado el
idioma en el que estarán las grabaciones y dictados.
¿QUÉ LE FALTA?
Echamos de menos tener el audio y el texto en la misma pantalla, algo útil en
caso de la transcripción de audios. Si estuviera esta función podrías ir
escuchando y corrigiendo los errores que pudieran surgir en el proceso, o cuando
hay una palabra puntual que en la transcripción no se comprende, poder volver al
audio e identificar cuál es esa palabra.
También sería muy útil un buscador de palabras en cada texto transcrito que
aparece en Notas. Para transcripciones más extensas sería bueno poder encontrar
palabras concretas que puede ser necesario ubicar específicamente sin tener que
utilizar el chatbot.
VIDEOTUTORIAL
Revisa el video para ver en vivo el funcionamiento de OpenWhispr.