Diktierfunktion für Windows — lokale oder Cloud-Spracheingabe in jeder App | NeuroSwitcher

Neu in der Pro-Beta · Spracheingabe

Spracheingabe für Windows in jeder App — standardmäßig lokal.

Diktat einschalten, Hotkey drücken und sagen, was Sie schreiben wollen — NeuroSwitcher tippt es ins aktive Fenster: Chat, Browser, Editor, IDE. Die Spracherkennung läuft standardmäßig auf Ihrem eigenen PC; oder wechseln Sie zu NeuroSwitcher Cloud ohne Einrichtung oder zur API Ihres Anbieters. Ohne Abo.

  • Lokal oder Cloud
  • CPU genügt
  • DE · EN · RU + HE Beta
  • Optionale KI-Korrektur
nachricht.txt

🎙 Aufnahme läuft… (F8 zum Stoppen)

Lass uns das Meeting auf Donnerstag um drei verschieben.

Lokales Modell · auf Ihrem PC transkribiert
Engine: läuft Backend: lokal / Cloud Hotkey: F8

So funktioniert es

Einschalten, F8 drücken, sprechen. Der Text landet beim Cursor.

Das Diktat von NeuroSwitcher ist eine kleine Sprach-Engine neben dem Layout-Umschalter, den Sie bereits nutzen. Der erkannte Text wird über denselben Eingabepfad getippt wie die Layout-Korrekturen — er funktioniert also in normalen Textfeldern in ganz Windows.

1

Diktat einschalten

Die Engine ist standardmäßig aus (sie hält das Modell im RAM). Starten Sie sie im Tray Voice → Diktat starten oder aktivieren Sie den Autostart beim Start im Voice-Tab der Pro Console.

2

F8 drücken — Aufnahme

Bei laufender Engine den Diktier-Hotkey drücken (F8 als Standard, konfigurierbar) und sprechen. Ein Indikator — und das Mikrofon-Symbol von Windows 11 — zeigen, dass das Mikrofon offen ist.

3

F8 drücken — Stopp

Erneut drücken schließt das Mikrofon, und der Text wird beim Cursor getippt. Mit dem lokalen Backend wird Audio im Arbeitsspeicher verarbeitet: nie auf die Festplatte geschrieben, nie irgendwohin gesendet.

4

Langes Diktat? VAD aktivieren

Standardmäßig wird die ganze Aufnahme beim Stopp transkribiert. Aktivieren Sie die VAD-Segmentierung (Tray → Voice → VAD-Segmentierung), damit die Rede an Pausen geteilt wird: Jeder Abschnitt wird sofort transkribiert und eingefügt — der Text fließt Satz für Satz, und Whispers ~30-Sekunden-Grenze pro Äußerung entfällt. Das VAD-Modell (Silero) ist bereits enthalten.

Erkennung

Wählen Sie, wo aus Sprache Text wird.

Die Spracherkennung hat drei Wege — wählen Sie nach Privatsphäre und Aufwand, im Voice-Tab der Pro Console (Bereich Erkennung / speech-to-text). Lokal ist der Standard und am privatesten; die Cloud-Wege tauschen etwas Privatsphäre gegen null Einrichtung oder Spitzengenauigkeit.

Lokales Modell · offline (Standard)

Laden Sie ein Erkennungsmodell mit einem Klick aus dem eingebauten Katalog (Pro Console → Voice), mit Fortschrittsanzeige. Klein und schnell oder größer und genauer. Nach dem Download läuft die Erkennung vollständig auf Ihrer CPU — ohne Internet, kein Audio verlässt den PC.

NeuroSwitcher Cloud

Null Einrichtung: kein Schlüssel, kein Modell-Download, mit einem kostenlosen Tageslimit. Die anonyme Install-ID Ihrer Maschine signiert die Anfrage. Das aufgenommene Audio geht an unseren Proxy und weiter an den Anbieter. Mehr über NeuroSwitcher Cloud →

Ihr eigener Anbieter

Richten Sie die Erkennung auf OpenAI (z. B. gpt-4o-mini-transcribe) oder einen beliebigen OpenAI-kompatiblen Endpunkt mit Ihrem API-Schlüssel. Das Audio geht direkt von Ihrem PC zu diesem Anbieter — ohne NeuroSwitcher-Server dazwischen.

Jederzeit umschaltbar

Das Backend ist ein Dropdown im Voice-Tab: lokal für Privatsphäre starten, für Genauigkeit ohne Einrichtung auf Cloud wechseln, und zurück. Nach einer Änderung die Sprach-Engine neu starten. Cloud-Backends sind stets optional.

Wann die Cloud bequemer ist: schwacher PC, Spitzengenauigkeit ohne großen Modell-Download, oder Hebräisch ohne Aufwand. Für Privatsphäre und Offline-Nutzung das lokale Modell.

Lokale Modelle

Welches lokale Erkennungsmodell wählen.

Für das lokale Backend werden Modelle aus dem eingebauten Katalog geladen (Pro Console → Voice, Ein-Klick-Installation mit Fortschritt). Es gibt kein einzelnes „bestes" — es hängt von Ihren Sprachen und Ihrem PC ab. Unsere Empfehlungen aus der Praxis:

Qwen3-ASR 0.6B · ~1 GBAm besten für DE/EN/RU und gemischte Sprache — erkennt einen Sprachmix in einem Satz in einem Durchlauf. Standardempfehlung für deutsch-/englisch-/russischsprachiges Diktat. Kein Hebräisch.
Whisper-base · ~200 MBLeichter Allrounder: DE/EN/RU plus Hebräisch (mit explizit gesetzter Sprache). Guter Einstieg und passend für schwächere Rechner.
Whisper-tiny · ~110 MBAm leichtesten und schnellsten; geringere Genauigkeit. Wenn Größe und Tempo wichtiger sind als Qualität.
Whisper-medium / large-v3 · ~1–2 GBHöchste Genauigkeit, inklusive Hebräisch. Brauchen mehr RAM und CPU — auf schwachem PC spürbar langsamer.

⚠️ Whisper erkennt die Sprache einmal pro Satz; für Sprache, die Sprachen innerhalb eines Satzes mischt, nehmen Sie Qwen3. Für Hebräisch nur Whisper (base / medium / large-v3) mit auf HE gesetzter Sprache — Qwen3 kann kein Hebräisch. Der Katalog enthält auch Modelle für andere Sprachen (Chinesisch, Japanisch, Kantonesisch).

Sprachen

Gebaut für Menschen, die in mehr als einer Sprache diktieren.

DeutschVolle Diktatqualität mit dem empfohlenen lokalen Modell.
EnglischVolle Diktatqualität, auch in gemischten Sätzen.
RussischVolle Diktatqualität mit dem empfohlenen lokalen Modell.
HebräischBeta: läuft über Whisper-Modelle mit Sprachhinweis; die Qualität wird weiter verbessert.

Die Erkennungssprache (Auto / DE / EN / RU / HE) wird im Voice-Menü des Trays oder im Voice-Tab der Pro Console gewählt. Für Hebräisch empfiehlt sich, die Sprache explizit zu setzen.

Diktat-Korrektur

Optional das rohe Transkript per LLM glätten.

Gesprochener Text kommt mit Füllwörtern, Fehlstarts und ohne Interpunktion. Ein optionaler LLM-Durchlauf schreibt das ganze Diktat um — Interpunktion, Füllwörter, Format — bevor es getippt wird. Standardmäßig aus; so schalten Sie es ein.

1 · Korrektur (LLM) einschaltenIm Tray Voice → Korrektur (LLM) aktivieren oder ein Korrektur-Backend im Voice-Tab der Pro Console wählen. Standardmäßig aus.
2 · Preset wählenEin Prompt-Preset im Tray Voice → Korrektur-Prompt wählen — Aufräumen, Formell, Locker, Stichpunkte, Zusammenfassen, Übersetzen und mehr. Das markierte Preset gilt für jedes Diktat.
3 · Prompts bearbeiten oder hinzufügenIm Voice-Tab der Pro Console (Bereich LLM-Prompts) können Sie jeden eingebauten Prompt bearbeiten — er wird der neue Standard dafür — oder eigene hinzufügen; das Tray-Menü aktualisiert sich.
4 · KI-Backend wählenKostenlos NeuroSwitcher Cloud, Ihr OpenAI-/OpenRouter-Schlüssel oder ein vollständig lokales Modell über Ollama oder LM Studio. Die Einrichtung ist mit dem Assistenten geteilt — siehe die Seite zum KI-Textassistenten.

Gleiche Datenschutzregeln: mit einem lokalen Modell bleibt die Korrektur auf Ihrem PC; mit einem Cloud-Modell geht der Transkripttext direkt zum gewählten Anbieter, über Ihren Schlüssel (oder das kostenlose NeuroSwitcher-Cloud-Kontingent).

Steuerung

Aus dem Tray oder der Pro Console — wie Sie mögen.

Voice-Menü im TrayEngine starten/stoppen, aktives Modell wechseln, Erkennungssprache setzen sowie Korrektur (LLM) und ihr Preset umschalten — ohne ein Fenster zu öffnen.
Voice-Tab in der Pro ConsoleModellkatalog mit Ein-Klick-Installation und Fortschritt, Erkennungs-Backend (lokal / Cloud / eigener Schlüssel), Engine-Status, Hotkey, Autostart und die Korrektur-Einstellungen an einem Ort.
Konfigurierbarer HotkeyF8 als Standard; ändern Sie ihn bei Konflikten mit Ihren Apps.
Engine auf AbrufDie Sprach-Engine läuft nur, wenn Sie sie starten: Sie hält das Modell im RAM und bleibt aus, bis Sie sie brauchen (oder Autostart aktivieren).

FAQ

Häufige Fragen zur Spracheingabe.

Wie starte ich das Diktieren?

Die Sprach-Engine ist standardmäßig aus. Starten Sie sie im Tray Voice → Diktat starten (oder aktivieren Sie den Autostart im Voice-Tab der Pro Console). Dann F8 drücken, um die Aufnahme zu starten, sprechen und erneut F8 zum Stoppen — der Text wird in die aktive App getippt.

Funktioniert es offline?

Ja, mit dem lokalen Erkennungsmodell — dem Standard. Nach der Installation läuft die Erkennung vollständig auf Ihrem PC ohne Internet (nur der einmalige Modell-Download braucht Netz). NeuroSwitcher Cloud und Backends mit eigenem Schlüssel sind optional und nutzen eine Verbindung.

Wird meine Stimme aufgezeichnet oder gespeichert?

Mit dem lokalen Backend nein: das Mikrofon ist nur zwischen explizitem Start und Stopp geöffnet, das Audio wird im Arbeitsspeicher transkribiert, nichts wird auf die Festplatte geschrieben oder hochgeladen. Wenn Sie ein Cloud-Erkennungs-Backend wählen (NeuroSwitcher Cloud oder Ihren Anbieter), wird das aufgenommene Audio zur Transkription an diesen Anbieter gesendet. Während der Aufnahme sind der NeuroSwitcher-Indikator und das Windows-Mikrofon-Symbol sichtbar.

Brauche ich einen starken PC oder eine GPU?

Nein. Diktierte Sätze sind kurz, und die lokalen Standardmodelle transkribieren sie auf einer gewöhnlichen CPU schneller als in Echtzeit. Größere, genauere Modelle stehen im Katalog — oder Sie verlagern die Erkennung ganz in ein Cloud-Backend.

In welchen Apps funktioniert es?

In jeder App mit normalem Textfeld: Browser, Chats, Editoren, IDEs, Office. Der Text wird über denselben Eingabepfad getippt, mit dem NeuroSwitcher Layouts korrigiert; die Ausschlussliste pro App gilt auch hier.

Wie gut ist Hebräisch?

Das Diktat auf Hebräisch ist Beta. Es läuft über Whisper-Modelle mit explizit gesetzter Sprache; die Ausgabe ist echter hebräischer Text, aber die Erkennungsqualität liegt noch hinter Deutsch, Englisch und Russisch. Daran wird aktiv gearbeitet.

Ist die Spracheingabe kostenlos?

Die Spracheingabe ist Teil der kostenlosen Pro-Beta. Der verwaltete Modellkatalog mit Ein-Klick-Installation ist ein Pro-Komfort; die Sprach-Engine selbst gehört zum offenen Kern. NeuroSwitcher Cloud hat ein kostenloses Tageslimit; Backends mit eigenem Schlüssel werden über Ihren Anbieter abgerechnet.

Mein Antivirus fragt nach Mikrofonzugriff für „ks-voice-host.exe“ — ist das normal?

Ja. Das Mikrofon öffnet nicht die Hauptanwendung, sondern ein eigener Erkennungsprozess: ks-voice-host.exe im Unterordner voice der NeuroSwitcher-Installation. Die Erkennung läuft bewusst in einem eigenen Prozess — das Sprachmodell bleibt vom Layout-Umschalter getrennt, damit ein Problem im einen das andere nicht mitreißt. Deshalb nennt die Abfrage von Windows oder Ihrer Sicherheitssoftware eine unbekannte Datei statt „NeuroSwitcher“. Einmal erlauben genügt.

Kostenlose Pro-Beta

Mit der Stimme tippen — auf Ihre Art.

NeuroSwitcher für Windows 10 und 11 herunterladen, den Voice-Tab öffnen, das Diktat einschalten und in jede App sprechen — mit einem lokalen Modell offline oder über NeuroSwitcher Cloud ohne Einrichtung.

NeuroSwitcher herunterladen

← Zurück zur NeuroSwitcher-Startseite