KI-Einstellungen
PhonerLite unterstützt 2 Arten von KI (Künstliche Intelligenz):
- Abfrage eines LLM (Large Language Model). Dabei handelt es sich um einen textbasierten Dialog. Es werden hierzu nur externe Dienste wie Google Gemini oder Ollama unterstützt. Letzteres kann lokal installiert werden.
- Transkription: Hierbei handelt es sich um die Wandlung von Sprache zu Text (STT - Speech To Text) und es wird auf die Implementierung von Whisper referenziert.
Datenschutz und Datenfluss
- Gemini: Anfragen werden an einen externen Cloud-Dienst übertragen. Nutzen Sie diese Option nur, wenn das zu Ihren Datenschutzanforderungen passt.
- Ollama: Verarbeitung erfolgt lokal auf dem eigenen Rechner. Ohne zusätzliche Cloud-Anbindung verlassen die Inhalte den Rechner nicht.
- Whisper-Transkription: Die Transkription läuft lokal in PhonerLite mit den installierten Modellen.
- TTS (Windows und Piper): Beide Varianten laufen lokal auf dem Rechner. Die zu sprechenden Texte verlassen den PC dabei nicht.
- API-Schlüssel: API-Zugänge sollten vertraulich behandelt und nicht an Dritte weitergegeben werden.
Prüfen Sie vor dem Einsatz, ob Gesprächsinhalte, Mitschnitte und Transkripte in Ihrer Umgebung verarbeitet oder gespeichert werden dürfen.
Gemini
Gemini ist eine Familie von KI-Modellen von Google. Sie können Text, Code, Bilder und mehr verstehen und erstellen. Dafür braucht man einen Gemini API-Schlüssel. Dann greift PhonerLite per REST-API auf den Online-Dienst von Google Gemini zu.
Der notwendige API-Schlüssel (Access Token) kann kostenlos hier erstellt werden: https://aistudio.google.com/app/api-keys
Um auf vorherige Fragen und Antworten aus dem Dialog Bezug nehmen zu können, sollte eine gewisse Verlaufslänge eingestellt sein. Über den ⟳-Button kann eine Liste der verfügbaren Modelle heruntergeladen werden.
Wenn ein gültiger API-Schlüssel hinterlegt und eine Internet-Verbindung vorhanden ist, kann mittels CLI (beispielsweise per "Ask"-Befehl) das automatisiert in ein Script integriert werden. Alternativ kann das auch interaktiv direkt auf der "Ausprobieren"-Seite getestet werden.
Ollama
Ollama ist ein Open-Source-Tool, das die lokale Ausführung großer Sprachmodelle (LLMs) wie Llama 3 oder Mistral auf dem eigenen Computer vereinfacht. Da die Modelle nach einem einmaligen Download direkt auf dem lokalen Gerät laufen, kann die KI offline genutzt werden, was maximale Datenkontrolle und Datenschutz gewährleistet.
Die Installation eines Ollama-Servers erfolgt typischerweise durch das Ausführen eines einfachen Installationsskripts oder eines Installers, wodurch ein lokaler Dienst eingerichtet wird. Dieser Server ist standardmäßig unter der REST-API-Adresse http://localhost:11434 erreichbar, um von Anwendungen mit den heruntergeladenen, lokalen Sprachmodellen zu interagieren. Die notwendige Hardware hängt direkt von der Größe des Sprachmodells (LLM) ab, das lokal mit Ollama ausgeführt werden soll. Für gängige Modelle (wie 7B-Parameter-Modelle) ist eine Mindestanforderung von 16 GB RAM und vorzugsweise eine dedizierte Grafikkarte (GPU) mit mindestens 8 GB VRAM empfehlenswert, da die GPU die Verarbeitungsgeschwindigkeit stark beschleunigt.
Transkribieren
Transkription bezeichnet den Prozess der Umwandlung gesprochener Sprache in einen geschriebenen Text. Dies geschieht automatisiert durch Spracherkennungssoftware (Speech-to-Text). PhonerLite verwendet dazu Whisper, das über den "Installieren"-Button heruntergeladen werden kann (465 MB).
Zusätzliche Modelle ("Medium [1,42 GB]" und "Large [2,88 GB]") können manuell installiert werden. Diese benötigen zwar wesentlich mehr CPU- bzw. GPU-Ressourcen, bieten dafür jedoch eine geringere Wortfehlerrate.
TTS
TTS (Text To Speech) bezeichnet die Umwandlung von Text in gesprochene Sprache. PhonerLite unterstützt dafür zwei Arten von TTS:
- Integriertes TTS in Windows: Welche Stimmen verfügbar sind, hängt von den in Windows installierten Sprachpaketen ab.
- Piper: Dieses TTS wird bei Bedarf dynamisch nachinstalliert und basiert auf https://github.com/rhasspy/piper.
Beim Download von Piper werden je nach Paket mehrere Sprachmodelle mit installiert.
Wichtiger Lizenzhinweis: Einzelne Stimmen haben eigene Datensatzlizenzen. Diese können die Nutzung stärker einschränken als die Piper-Software selbst.
- thorsten (high, de_DE): Quelle/Model Card rhasspy/piper-voices (thorsten/high), Lizenz: CC0.
- dii (high, de_DE): Datensatz OpenVoiceOS/pipertts_de-DE_dii (Jarbas/tts-train-synthetic-dii_de-DE), Lizenz: CC BY-NC-SA 4.0. Kommerzielle Nutzung ist hier nicht erlaubt.
- alan (medium, en_GB): Quelle/Model Card rhasspy/piper-voices (alan/medium), Lizenz: Repository-Lizenz.
- amy (medium, en_US): Quelle/Model Card rhasspy/piper-voices (amy/medium), Lizenz: Repository-Lizenz.
- ryan (high, en_US): Quelle/Model Card rhasspy/piper-voices (ryan/high), Lizenz: CC BY-NC-SA 4.0. Kommerzielle Nutzung ist hier nicht erlaubt.
- davefx (medium, es_ES): Quelle/Model Card rhasspy/piper-voices (davefx/medium), Lizenz: CC0.
- siwis (medium, fr_FR): Quelle/Model Card rhasspy/piper-voices (siwis/medium), Lizenz: CC-BY 4.0.
- dmitri (medium, ru_RU): Quelle/Model Card rhasspy/piper-voices (dmitri/medium), Lizenz: CC0.
Einige Stimmen sind nach dem Download verfügbar und können über den Play-Button ausprobiert werden.
Die Stimmen aus dem integrierten Windows-TTS beginnen mit "Microsoft", die heruntergeladenen Stimmen mit "Piper".
Ausprobieren
Auf dieser Seite kann man interaktiv einen Dialog mit einer KI-Gegenstelle (Gemini oder Ollama) führen. Um die Transkription zu testen, muss man den ▶-Button mit gedrückter Strg-Taste lange anklicken. Während dieser Zeit wird das Mikrofonsignal in Text umgewandelt.
