Ir al contenido
Traducción automática sin revisar. Cómo contribuir a la traducción.

Primeros pasos

Esta página da por hecho que Utter está instalado. Si no lo está, empieza por el resumen de instalación.

  • Linux en Wayland. niri y KDE Plasma (KWin) son compatibles de primera clase; otros compositores tienen soporte parcial (dictado, escritura, inicio; sin acciones de ventana). macOS es experimental.
  • PipeWire para el audio.
  • Python 3.12 o posterior.
  • Se recomienda una GPU NVIDIA para los modelos más grandes, pero no es obligatoria. Utter funciona sin ningún modelo y con reconocimiento de voz solo por CPU.

1. Inicia el runner y abre la aplicación de ajustes

Sección titulada «1. Inicia el runner y abre la aplicación de ajustes»
Ventana de terminal
systemctl --user enable --now utter-runner.service # start the background runner
assistant doctor # check tools, plugins and permissions
utter-gui # open the settings window

Si no se encuentra utter-gui, probablemente el prefijo del instalador no esté en tu PATH:

Ventana de terminal
export PATH="$HOME/.local/bin:$PATH"

assistant doctor te dice qué herramientas de línea de comandos faltan y si tu usuario puede leer dispositivos de entrada. Las soluciones más habituales están en Solución de problemas.

2. Configura tus teclas de pulsar para hablar {#2-set-your-push-to-talk-keys}

Sección titulada «2. Configura tus teclas de pulsar para hablar {#2-set-your-push-to-talk-keys}»

Utter tiene dos teclas de pulsar para hablar, una por modo. Ambas son nombres de tecla evdev sin más y se configuran en la página Voice de la aplicación de ajustes, o bajo [ptt] en ~/.config/utter/config.toml:

[ptt]
dictation_key = "KEY_F13"
assistant_key = "KEY_INSERT"
ManténQué ocurre con tus palabrasEn pantalla
Asistentela tecla del asistente (Insert por defecto)Se convierte en una acción: abrir aplicaciones y sitios, hacer clic, pulsar atajosUna onda amarilla
Dictadola tecla de dictado (F13 por defecto)Se escribe en el campo que tenga el focoUna onda azul con «Dictation · typing»

Cada modo tiene su propio sonido de inicio, así que puedes distinguirlos sin mirar.

Los valores por defecto asumen un remapeo de teclado que convierte una tecla física incómoda en Insert o F13. La mayoría de la gente querrá teclas que estén realmente en su teclado. Cualquier nombre de evdev sirve (KEY_RIGHTCTRL, KEY_PAUSE, KEY_SCROLLLOCK, …). Si usas keyd, la guía de configuración muestra cómo asignar Bloq Mayús y Alt derecha a los valores por defecto.

El detector de teclas solo necesita que tu usuario esté en el grupo input. Nunca captura el teclado, así que la tecla sigue funcionando en las demás aplicaciones.

Abre la página Models. La sección Recommended for your computer examina tu procesador, memoria y tarjeta gráfica y sugiere un modelo por nivel:

NivelQué hacePara qué se necesita
Reconocimiento de vozconvierte tu voz en textotodo lo que dices
Modelo de decisiónelige entre acciones preparadas cuando no coincide ninguna reglafrases más difusas («pull up youtube»)
Visión de pantallaencuentra un elemento descrito en una captura«click the search box» cuando falla la accesibilidad

No se descarga nada sin ti. Empieza por el reconocimiento de voz: sin él, la tecla del asistente no tiene nada que transcribir. Los modelos de decisión y visión son opcionales y pueden añadirse después.

Pulsa Get it junto a una recomendación, o pega una fuente como hf:org/name en Add a model. Las descargas se reanudan si se interrumpen y se verifican con su resumen SHA-256. La guía de modelos enumera lo recomendado para cada clase de GPU y cómo funciona el almacén de modelos.

Mantén la tecla del asistente, di «open youtube» y suelta. Se abre un navegador o se enfoca una pestaña de YouTube existente. Luego prueba:

  • «close this», «fullscreen», «workspace 3», «focus right» (control de ventanas y espacios de trabajo)
  • «pause», «next track» (cualquier reproductor multimedia MPRIS)
  • «new tab», «find» (los atajos de la propia aplicación enfocada)
  • «click the search box» (primero accesibilidad y luego visión, si la instalaste)

Mantén la tecla de dictado y habla para escribir en el campo enfocado. El dictado nunca ejecuta comandos.

Para ver qué haría Utter sin hacerlo, usa el modo de prueba desde un checkout del código:

Ventana de terminal
python3 -m utter.daemon --text "open youtube" --dry-run

Di «go to sleep» en modo asistente y Utter libera tu tarjeta gráfica. Los servicios del modelo de IA se detienen, el modelo de voz se descarga y solo queda vivo un diminuto detector. Mantén cualquiera de las teclas de pulsar para hablar para despertarlo: la voz vuelve en una fracción de segundo y los modelos más grandes se recargan en segundo plano.

Utter también se duerme solo tras 15 minutos sin usarse. Solo cuenta la actividad de Utter (una tecla de pulsar para hablar, un comando hablado, despertarse), nunca escribir o hacer clic en otras aplicaciones, así que la tarjeta gráfica se libera mientras trabajas. Despertarlo es la misma pulsación de tecla.

La frase y el temporizador son tuyos, en la página General o en el archivo de configuración:

[sleep]
enabled = true
trigger = ["go to sleep", "take a break"]
services = ["utter-vision", "utter-planner"] # what gets unloaded
unload_speech = true
on_idle = true # sleep by itself when unused…
idle_minutes = 15 # …after this long
  • Configuración para cada sección de configuración, los motores de voz, la cabeza de decisión, la visión y el audio.
  • Aplicaciones y acciones para editar los atajos de una aplicación o enseñarle a Utter una nueva aplicación.
  • Confianza y seguridad antes de activar comandos de terminal o entrada sin procesar.