Erste Schritte
Diese Seite setzt voraus, dass Utter installiert ist. Falls nicht, beginne mit der Installationsübersicht.
Voraussetzungen
Abschnitt betitelt „Voraussetzungen“- Linux unter Wayland. niri und KDE Plasma (KWin) sind erstklassig; andere Compositor erhalten teilweise Unterstützung (Diktat, Tippen, Starten; keine Fensteraktionen). macOS ist experimentell.
- PipeWire für Audio.
- Python 3.12 oder neuer.
- Für die größeren Modelle wird eine NVIDIA-GPU empfohlen, ist aber nicht erforderlich. Utter läuft auch ohne Modelle und mit reiner CPU-Spracherkennung.
1. Starte den Runner und öffne die Einstellungs-App
Abschnitt betitelt „1. Starte den Runner und öffne die Einstellungs-App“systemctl --user enable --now utter-runner.service # start the background runnerassistant doctor # check tools, plugins and permissionsutter-gui # open the settings windowWenn utter-gui nicht gefunden wird, liegt das Präfix des Installers wahrscheinlich nicht in deinem PATH:
export PATH="$HOME/.local/bin:$PATH"assistant doctor sagt dir, welche Kommandozeilenwerkzeuge fehlen und ob dein Benutzer
Eingabegeräte lesen kann. Die häufigsten Lösungen findest du unter Fehlerbehebung.
2. Lege deine Push-to-Talk-Tasten fest {#2-set-your-push-to-talk-keys}
Abschnitt betitelt „2. Lege deine Push-to-Talk-Tasten fest {#2-set-your-push-to-talk-keys}“Utter hat zwei Push-to-Talk-Tasten, eine pro Modus. Beide sind einfache evdev-Tastennamen und werden
auf der Seite Stimme der Einstellungs-App oder unter [ptt] in
~/.config/utter/config.toml festgelegt:
[ptt]dictation_key = "KEY_F13"assistant_key = "KEY_INSERT"| Halten | Was mit deinen Worten passiert | Auf dem Bildschirm | |
|---|---|---|---|
| Assistent | die Assistenten-Taste (standardmäßig Insert) | Wird zu einer Aktion: Apps und Seiten öffnen, klicken, Kürzel drücken | Eine gelbe Wellenform |
| Diktat | die Diktat-Taste (standardmäßig F13) | Wird in das fokussierte Feld getippt | Eine blaue Wellenform mit „Dictation · typing“ |
Jeder Modus hat seinen eigenen Startklang, du kannst sie also unterscheiden, ohne hinzusehen.
Die Standardwerte gehen von einer Tastaturbelegung aus, die eine unbequeme physische Taste in Insert oder F13 verwandelt.
Die meisten werden Tasten wollen, die tatsächlich auf ihrer Tastatur sind. Jeder evdev-Name funktioniert
(KEY_RIGHTCTRL, KEY_PAUSE, KEY_SCROLLLOCK, …). Wenn du keyd verwendest, zeigt die
Konfigurationsanleitung, wie du Caps Lock und rechte Alt-Taste
den Standardwerten zuordnest.
Der Tasten-Listener braucht nur, dass dein Benutzer in der Gruppe input ist. Er erobert die Tastatur nie,
also funktioniert die Taste auch für andere Apps weiter.
3. Wähle ein erstes Modell
Abschnitt betitelt „3. Wähle ein erstes Modell“Öffne die Seite Modelle. Der Abschnitt Recommended for your computer schaut auf deinen Prozessor, Arbeitsspeicher und deine Grafikkarte und schlägt ein Modell pro Stufe vor:
| Stufe | Was es tut | Benötigt für |
|---|---|---|
| Spracherkennung | wandelt deine Stimme in Text um | alles, was du sagst |
| Entscheidungsmodell | wählt unter vorbereiteten Aktionen, wenn keine Regel passt | unschärfere Formulierungen („pull up youtube“) |
| Bildschirm-Vision | findet ein beschriebenes Element in einem Screenshot | „click the search box“, wenn Barrierefreiheit versagt |
Nichts wird ohne dich heruntergeladen. Beginne mit der Spracherkennung: Ohne sie hat die Assistenten-Taste nichts zu transkribieren. Das Entscheidungs- und das Vision-Modell sind optional und können später hinzugefügt werden.
Drücke Get it neben einem Vorschlag, oder füge eine Quelle wie hf:org/name in
Add a model ein. Downloads werden bei Unterbrechung fortgesetzt und gegen ihren SHA-256-Digest geprüft.
Die Modelle-Anleitung listet, was für jede GPU-Klasse empfohlen wird und wie der
Modellspeicher funktioniert.
4. Sag etwas
Abschnitt betitelt „4. Sag etwas“Halte die Assistenten-Taste, sag „open youtube“, lass los. Ein Browser öffnet sich oder ein vorhandener YouTube- Tab wird fokussiert. Probiere dann:
- „close this“, „fullscreen“, „workspace 3“, „focus right“ (Fenster- und Arbeitsbereichssteuerung)
- „pause“, „next track“ (jeder MPRIS-Mediaplayer)
- „new tab“, „find“ (die eigenen Kürzel der fokussierten App)
- „click the search box“ (zuerst Barrierefreiheit, dann Vision, falls installiert)
Halte die Diktat-Taste und sprich, um in das fokussierte Feld zu tippen. Diktat führt nie Befehle aus.
Um zu sehen, was Utter tun würde, ohne es zu tun, verwende den Testlauf aus einem Quellcode-Checkout:
python3 -m utter.daemon --text "open youtube" --dry-run5. Schlafmodus {#5-sleep-mode}
Abschnitt betitelt „5. Schlafmodus {#5-sleep-mode}“Sag „go to sleep“ im Assistentenmodus und Utter gibt deine Grafikkarte frei. Die KI-Modell- dienste stoppen, das Sprachmodell wird entladen, und nur ein winziger Listener bleibt aktiv. Halte eine der beiden Push-to-Talk-Tasten, um ihn zu wecken: Sprache ist im Bruchteil einer Sekunde zurück, und die größeren Modelle laden im Hintergrund nach.
Utter schläft auch von selbst ein, nach 15 Minuten ohne Benutzung. Nur Utter-Aktivität zählt (eine Push-to-Talk-Taste, ein gesprochener Befehl, Aufwachen), niemals Tippen oder Klicken in anderen Apps, die Grafikkarte wird also frei, während du arbeitest. Das Aufwecken ist derselbe Tastendruck.
Die Formulierung und der Timer sind deine Wahl, auf der Seite Allgemein oder in der Konfigurationsdatei:
[sleep]enabled = truetrigger = ["go to sleep", "take a break"]services = ["utter-vision", "utter-planner"] # what gets unloadedunload_speech = trueon_idle = true # sleep by itself when unused…idle_minutes = 15 # …after this longNächste Schritte
Abschnitt betitelt „Nächste Schritte“- Konfiguration für jeden Konfigurationsabschnitt, Sprach-Backends, den Entscheidungskopf, Vision und Audio.
- Apps und Aktionen, um die Kürzel einer App zu bearbeiten oder Utter eine neue Anwendung beizubringen.
- Vertrauen und Sicherheit, bevor du Terminalbefehle oder Roheingabe aktivierst.