Usar ChatGPT por voz

Usar ChatGPT por voz: prompts de voz en cualquier app (Mac & Windows)

Usa ChatGPT por voz en cualquier app en Mac y Windows: prompts de voz con un atajo, respuesta en el cursor, tu propio modelo, transcripción local.

por Ownvox7 min de lectura
Usar ChatGPT por voz: prompts de voz en cualquier app (Mac & Windows)

Estás escribiendo un correo y quieres preguntarle rápido a ChatGPT cómo formular un párrafo de forma más cortés. Así que cambias a la ventana de ChatGPT, tecleas el prompt, copias la respuesta, vuelves, pegas. Tres cambios de contexto para una sola pregunta. Justo aquí se desmorona la ventaja que un asistente de IA debería darte.

ChatGPT tiene su propio modo de voz, sí, pero vive solo dentro de la app de ChatGPT. En cuanto trabajas en Outlook, en tu editor de código o en Notion, vuelves a teclear y a copiar de un lado a otro. La pregunta real, entonces, no es «¿puedo hablar con ChatGPT?», sino «¿puedo hablar con ChatGPT sin salir de la app en la que ya estoy trabajando?».

Eso es lo que significa usar ChatGPT por voz en este artículo: pulsas un atajo, dictas tu prompt, y la respuesta aparece justo en el cursor, en cualquier app. Sin ventana aparte, sin copiar y pegar. El reconocimiento de voz se ejecuta localmente en tu dispositivo, y el modelo que hay detrás lo eliges tú.

Qué significa de verdad «usar ChatGPT por voz»

Hay dos formas muy distintas de manejar ChatGPT con la voz.

La primera es el modo de voz integrado de ChatGPT. Hablas, ChatGPT responde, todo dentro de la interfaz de ChatGPT. Es estupendo para una conversación o para preguntar algo sobre la marcha, pero está atado a una sola app. Lo que obtienes ahí, luego tienes que moverlo a mano hasta donde realmente lo necesitas.

La segunda es un prompt de voz a nivel de sistema. Aquí la capa de voz no está dentro de ChatGPT sino a nivel del sistema operativo. La activas con un atajo global en cualquier aplicación, dictas tu pregunta, y la respuesta de la IA se inserta exactamente donde está tu cursor. El modelo de fondo puede ser ChatGPT, pero también otro, según lo que configures.

La diferencia parece pequeña pero cambia por completo el uso diario. Dejas de «ir a ChatGPT». Te llevas ChatGPT a todas partes.

Por qué el modo de voz de ChatGPT no basta en el trabajo real

Imagina que trabajas en una pull request y quieres mejorar un mensaje de commit. Con el modo de voz de ChatGPT tendrías que salir del editor de código, hablar en la app de ChatGPT, copiar la respuesta y devolverla al editor. La voz te ahorra teclear el prompt, pero la parte cara permanece: salir de tu herramienta y volver a ella.

Ese cambio es la fricción oculta. Cuesta no solo segundos, sino que te arranca del pensamiento en el que estás. Un prompt de voz a nivel de sistema lo elimina por completo, porque pregunta y respuesta ocurren en el mismo lugar: donde ya estás escribiendo.

Cómo funciona un prompt de voz a nivel de sistema

El texto seleccionado en una ventana de app se envía a la IA por voz y se reemplaza justo en el cursor con la respuesta mejorada

Para que funcione, encajan tres piezas.

Primero, el atajo global. Una app de escritorio como Ownvox registra una combinación de teclas en el sistema operativo que responde con independencia del programa activo. La pulsas en el navegador, el editor o el correo, y la grabación arranca enseguida, sin cambiar a ningún sitio.

Después, la transcripción local. Tu pregunta hablada se convierte en texto directamente en tu dispositivo, con modelos locales como Whisper o Parakeet. Este paso no necesita internet y no envía tu voz a ningún servidor.

Por último, el verdadero prompt a la IA. El texto transcrito va como prompt al modelo que elegiste, y la respuesta se inserta exactamente donde está tu cursor. Especialmente práctico: si seleccionaste texto antes, se envía automáticamente como contexto. Así puedes resaltar un párrafo y decir simplemente «hazlo más corto y neutral» sin copiar nada.

Para las bases del dictado a nivel de sistema, justo en el cursor, mira nuestro artículo sobre el dictado Whisper en cualquier app.

Tú aportas tu propio acceso a ChatGPT

Una capa de voz central se conecta a tres opciones de modelo, tu propia clave API, un endpoint local y una nube europea, e inserta el resultado en el cursor

Esta es la parte honesta y a la vez la más fuerte: la capa de voz aporta la herramienta, el modelo lo aportas tú. Con Ownvox tienes tres formas de hacerlo.

Puedes añadir tu propia clave API, por ejemplo a través de OpenRouter, y así dirigirte directamente a ChatGPT o a los modelos de OpenAI. Puedes usar tu propio endpoint o uno autoalojado si prefieres un modelo local o tu propia infraestructura. O usas la nube europea de Ownvox, cuya inferencia se ejecuta en Scaleway en Francia y cuyo proxy está en Hetzner en Alemania.

Lo bueno: no quedas atado a un solo modelo. ChatGPT hoy, otro modelo mañana, según la tarea y el presupuesto. El uso por voz se mantiene siempre igual.

Dónde es mayor la palanca en el día a día

Al escribir correos y mensajes redactas un borrador y lo haces pulir, acortar o ajustar de tono con un prompt de voz, sin salir de Outlook o Slack. En el editor de código haces redactar mensajes de commit, descripciones de PR o documentación mientras te quedas en el código. En notas y documentos dictas una idea en bruto y la haces ampliar directamente a un esquema. Y mientras investigas en el navegador resaltas un pasaje y pides un resumen por voz, sin cambiar de pestaña.

El denominador común: no tienes que aprender una integración de IA propia para ninguna de estas apps. Un solo atajo, el mismo gesto en todas partes.

Privacidad: qué se queda local y qué no

Siendo honestos, este es un punto en el que muchas herramientas se vuelven vagas, así que aquí va claramente separado. La transcripción de tu voz se ejecuta por defecto en local en tu dispositivo, tus datos de audio no salen de él. El prompt en sí va al modelo que elegiste. Si usas tu propia clave de ChatGPT, se aplican las condiciones de OpenAI. Si usas un endpoint local, ese paso también se queda de tu lado. Si usas la nube europea de Ownvox, el procesamiento se mantiene dentro de la UE.

Lo que importa es el control: un interruptor de privacidad desactiva todas las funciones de nube con un clic, de modo que solo quedan activos los modelos locales. Así decides, tarea por tarea, si manda la velocidad o la máxima soberanía de los datos.

Mac y Windows: una palabra rápida sobre la configuración

Para que el prompt de voz en el cursor funcione, la app necesita dos permisos: acceso al micrófono y, para la inserción en otras apps, la accesibilidad en macOS o el acceso a la entrada correspondiente en Windows. En Apple Silicon la transcripción local se ejecuta de forma especialmente eficiente, y en Windows una GPU o una NPU acelera el reconocimiento. Después solo te queda recordar un atajo.

Preguntas frecuentes sobre usar ChatGPT por voz

¿Necesito una suscripción a ChatGPT para esto?

Necesitas acceso a un modelo. Puede ser tu propia clave de OpenAI o ChatGPT a través de OpenRouter, tu propio endpoint, o la nube europea de Ownvox. Qué modelo usas lo decides tú.

¿Es lo mismo que el modo de voz de ChatGPT?

No. El modo de voz de ChatGPT solo funciona dentro de la app de ChatGPT. Un prompt de voz a nivel de sistema funciona en cualquier app e inserta la respuesta justo en tu cursor.

¿Se envía mi voz a la nube?

La transcripción se ejecuta por defecto en local, tus datos de audio se quedan en el dispositivo. Solo el prompt de texto terminado va al modelo que elegiste. Con el interruptor de privacidad puedes apagar por completo las funciones de nube.

¿Funciona de verdad en cualquier app?

En cualquier app con un campo de entrada de texto normal: navegadores, clientes de correo, herramientas de chat, editores, programas de oficina. Los campos que aíslan técnicamente la entrada son la rara excepción.

¿Puedo pasar texto seleccionado como contexto?

Sí. Si seleccionas texto antes de hablar, se pasa automáticamente a la IA como contexto. Así puedes hacer reescribir pasajes existentes sin copiar nada.

¿Funciona sin internet?

La transcripción sí. Para la respuesta de la IA depende del modelo: un endpoint local funciona sin conexión, un modelo en la nube como ChatGPT necesita conexión.

Conclusión: lleva ChatGPT a donde trabajas

Usar ChatGPT por voz es mucho más que el modo de voz integrado. El verdadero salto ocurre cuando puedes hablar en cualquier app y la respuesta llega justo al cursor, sin cambio de ventana y sin portapapeles. La voz te ahorra teclear, la integración a nivel de sistema te ahorra el cambio de contexto, y la libre elección de modelo te mantiene independiente.

Si pasas todo el día entre tus programas y una pestaña de IA, un prompt de voz a nivel de sistema es probablemente justo lo que hace innecesario ese cambio.

Ownvox: prompts de voz para ChatGPT y cualquier otra IA

Ownvox se construyó para esto. Pulsas tu atajo, hablas, y la respuesta de la IA aparece justo en el cursor, en cualquier app en Mac y Windows. La transcripción se ejecuta en local, el texto seleccionado se pasa automáticamente como contexto, y el modelo lo eliges tú: tu propia clave de ChatGPT a través de OpenRouter, tu propio endpoint, o la nube europea de Ownvox. Un interruptor de privacidad desactiva la nube en cualquier momento con un clic.

Si quieres usar ChatGPT por voz sin cambiar de app constantemente, Ownvox es el camino más directo.

Más artículos