Zum Inhalt springen
Maschinell übersetzt, nicht geprüft. So hilfst du bei der Übersetzung.

Erste Schritte

Diese Seite setzt voraus, dass Utter installiert ist. Falls nicht, beginne mit der Installationsübersicht.

  • Linux unter Wayland. niri und KDE Plasma (KWin) sind erstklassig; andere Compositor erhalten teilweise Unterstützung (Diktat, Tippen, Starten; keine Fensteraktionen). macOS ist experimentell.
  • PipeWire für Audio.
  • Python 3.12 oder neuer.
  • Für die größeren Modelle wird eine NVIDIA-GPU empfohlen, ist aber nicht erforderlich. Utter läuft auch ohne Modelle und mit reiner CPU-Spracherkennung.

1. Starte den Runner und öffne die Einstellungs-App

Abschnitt betitelt „1. Starte den Runner und öffne die Einstellungs-App“
Terminal-Fenster
systemctl --user enable --now utter-runner.service # start the background runner
assistant doctor # check tools, plugins and permissions
utter-gui # open the settings window

Wenn utter-gui nicht gefunden wird, liegt das Präfix des Installers wahrscheinlich nicht in deinem PATH:

Terminal-Fenster
export PATH="$HOME/.local/bin:$PATH"

assistant doctor sagt dir, welche Kommandozeilenwerkzeuge fehlen und ob dein Benutzer Eingabegeräte lesen kann. Die häufigsten Lösungen findest du unter Fehlerbehebung.

2. Lege deine Push-to-Talk-Tasten fest {#2-set-your-push-to-talk-keys}

Abschnitt betitelt „2. Lege deine Push-to-Talk-Tasten fest {#2-set-your-push-to-talk-keys}“

Utter hat zwei Push-to-Talk-Tasten, eine pro Modus. Beide sind einfache evdev-Tastennamen und werden auf der Seite Stimme der Einstellungs-App oder unter [ptt] in ~/.config/utter/config.toml festgelegt:

[ptt]
dictation_key = "KEY_F13"
assistant_key = "KEY_INSERT"
HaltenWas mit deinen Worten passiertAuf dem Bildschirm
Assistentdie Assistenten-Taste (standardmäßig Insert)Wird zu einer Aktion: Apps und Seiten öffnen, klicken, Kürzel drückenEine gelbe Wellenform
Diktatdie Diktat-Taste (standardmäßig F13)Wird in das fokussierte Feld getipptEine blaue Wellenform mit „Dictation · typing“

Jeder Modus hat seinen eigenen Startklang, du kannst sie also unterscheiden, ohne hinzusehen.

Die Standardwerte gehen von einer Tastaturbelegung aus, die eine unbequeme physische Taste in Insert oder F13 verwandelt. Die meisten werden Tasten wollen, die tatsächlich auf ihrer Tastatur sind. Jeder evdev-Name funktioniert (KEY_RIGHTCTRL, KEY_PAUSE, KEY_SCROLLLOCK, …). Wenn du keyd verwendest, zeigt die Konfigurationsanleitung, wie du Caps Lock und rechte Alt-Taste den Standardwerten zuordnest.

Der Tasten-Listener braucht nur, dass dein Benutzer in der Gruppe input ist. Er erobert die Tastatur nie, also funktioniert die Taste auch für andere Apps weiter.

Öffne die Seite Modelle. Der Abschnitt Recommended for your computer schaut auf deinen Prozessor, Arbeitsspeicher und deine Grafikkarte und schlägt ein Modell pro Stufe vor:

StufeWas es tutBenötigt für
Spracherkennungwandelt deine Stimme in Text umalles, was du sagst
Entscheidungsmodellwählt unter vorbereiteten Aktionen, wenn keine Regel passtunschärfere Formulierungen („pull up youtube“)
Bildschirm-Visionfindet ein beschriebenes Element in einem Screenshot„click the search box“, wenn Barrierefreiheit versagt

Nichts wird ohne dich heruntergeladen. Beginne mit der Spracherkennung: Ohne sie hat die Assistenten-Taste nichts zu transkribieren. Das Entscheidungs- und das Vision-Modell sind optional und können später hinzugefügt werden.

Drücke Get it neben einem Vorschlag, oder füge eine Quelle wie hf:org/name in Add a model ein. Downloads werden bei Unterbrechung fortgesetzt und gegen ihren SHA-256-Digest geprüft. Die Modelle-Anleitung listet, was für jede GPU-Klasse empfohlen wird und wie der Modellspeicher funktioniert.

Halte die Assistenten-Taste, sag „open youtube“, lass los. Ein Browser öffnet sich oder ein vorhandener YouTube- Tab wird fokussiert. Probiere dann:

  • „close this“, „fullscreen“, „workspace 3“, „focus right“ (Fenster- und Arbeitsbereichssteuerung)
  • „pause“, „next track“ (jeder MPRIS-Mediaplayer)
  • „new tab“, „find“ (die eigenen Kürzel der fokussierten App)
  • „click the search box“ (zuerst Barrierefreiheit, dann Vision, falls installiert)

Halte die Diktat-Taste und sprich, um in das fokussierte Feld zu tippen. Diktat führt nie Befehle aus.

Um zu sehen, was Utter tun würde, ohne es zu tun, verwende den Testlauf aus einem Quellcode-Checkout:

Terminal-Fenster
python3 -m utter.daemon --text "open youtube" --dry-run

Sag „go to sleep“ im Assistentenmodus und Utter gibt deine Grafikkarte frei. Die KI-Modell- dienste stoppen, das Sprachmodell wird entladen, und nur ein winziger Listener bleibt aktiv. Halte eine der beiden Push-to-Talk-Tasten, um ihn zu wecken: Sprache ist im Bruchteil einer Sekunde zurück, und die größeren Modelle laden im Hintergrund nach.

Utter schläft auch von selbst ein, nach 15 Minuten ohne Benutzung. Nur Utter-Aktivität zählt (eine Push-to-Talk-Taste, ein gesprochener Befehl, Aufwachen), niemals Tippen oder Klicken in anderen Apps, die Grafikkarte wird also frei, während du arbeitest. Das Aufwecken ist derselbe Tastendruck.

Die Formulierung und der Timer sind deine Wahl, auf der Seite Allgemein oder in der Konfigurationsdatei:

[sleep]
enabled = true
trigger = ["go to sleep", "take a break"]
services = ["utter-vision", "utter-planner"] # what gets unloaded
unload_speech = true
on_idle = true # sleep by itself when unused…
idle_minutes = 15 # …after this long
  • Konfiguration für jeden Konfigurationsabschnitt, Sprach-Backends, den Entscheidungskopf, Vision und Audio.
  • Apps und Aktionen, um die Kürzel einer App zu bearbeiten oder Utter eine neue Anwendung beizubringen.
  • Vertrauen und Sicherheit, bevor du Terminalbefehle oder Roheingabe aktivierst.