<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="de">
	<id>https://mediawiki.wissen-ahrensburg.de/index.php?action=history&amp;feed=atom&amp;title=Text-to-Speech_%28TTS%29_auf_Ubuntu</id>
	<title>Text-to-Speech (TTS) auf Ubuntu - Versionsgeschichte</title>
	<link rel="self" type="application/atom+xml" href="https://mediawiki.wissen-ahrensburg.de/index.php?action=history&amp;feed=atom&amp;title=Text-to-Speech_%28TTS%29_auf_Ubuntu"/>
	<link rel="alternate" type="text/html" href="https://mediawiki.wissen-ahrensburg.de/index.php?title=Text-to-Speech_(TTS)_auf_Ubuntu&amp;action=history"/>
	<updated>2026-08-19T18:25:47Z</updated>
	<subtitle>Versionsgeschichte dieser Seite in Dokument</subtitle>
	<generator>MediaWiki 1.46.0</generator>
	<entry>
		<id>https://mediawiki.wissen-ahrensburg.de/index.php?title=Text-to-Speech_(TTS)_auf_Ubuntu&amp;diff=591&amp;oldid=prev</id>
		<title>imported&gt;Import: Version 527</title>
		<link rel="alternate" type="text/html" href="https://mediawiki.wissen-ahrensburg.de/index.php?title=Text-to-Speech_(TTS)_auf_Ubuntu&amp;diff=591&amp;oldid=prev"/>
		<updated>2026-05-19T12:26:45Z</updated>

		<summary type="html">&lt;p&gt;Version 527&lt;/p&gt;
&lt;p&gt;&lt;b&gt;Neue Seite&lt;/b&gt;&lt;/p&gt;&lt;div&gt;&amp;#039;&amp;#039;Hinweis: Diese Inhalte wurden mit Unterstützung von Künstlicher Intelligenz erstellt und redaktionell überprüft (Transparenzhinweis gemäß Art. 50 EU AI Act).&amp;#039;&amp;#039;&lt;br /&gt;
----&lt;br /&gt;
&lt;br /&gt;
Diese Seite bietet eine Übersicht über verschiedene Text-to-Speech (TTS) Modelle und deren Installation auf einem Ubuntu 26.04 Rechner.&lt;br /&gt;
&lt;br /&gt;
== Folgende Themen für Ubuntu-Rechner ==&lt;br /&gt;
&lt;br /&gt;
=== Piper TTS ===&lt;br /&gt;
Piper TTS ist ein schnelles, lokales und ressourcenschonendes TTS-System, das für den Einsatz auf CPUs optimiert ist.&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Eigenschaften:&amp;#039;&amp;#039;&amp;#039; Sehr schnell, benötigt keine Grafikkarte (GPU) und ist ideal für Edge-Geräte (z.B. Raspberry Pi) oder schwächere Laptops.&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Installation (Binary):&amp;#039;&amp;#039;&amp;#039; Es wird als fertiges ausführbares Programm bereitgestellt.&lt;br /&gt;
&amp;lt;pre&amp;gt;&lt;br /&gt;
mkdir -p ~/.local/share/piper-tts&lt;br /&gt;
# Neuestes Release für Linux x86_64 von GitHub herunterladen und entpacken:&lt;br /&gt;
tar -xf piper_linux_x86_64.tar.gz -C ~/.local/share/piper-tts --strip-components=1&lt;br /&gt;
&amp;lt;/pre&amp;gt;&lt;br /&gt;
* Um Piper zu nutzen, benötigt man noch eine `.onnx` Modell-Datei und eine `.onnx.json` Konfigurationsdatei für die jeweilige Stimme.&lt;br /&gt;
&lt;br /&gt;
=== Kokoro (via kokoro-onnx) ===&lt;br /&gt;
Kokoro ist ein hocheffizientes Modell (mit nur ca. 82 Millionen Parametern), das eine exzellente Audioqualität bei minimalen Hardware-Anforderungen liefert.&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Eigenschaften:&amp;#039;&amp;#039;&amp;#039; Sehr leichtgewichtig, läuft hervorragend auf der CPU, erzeugt sehr natürliche Stimmen. Gilt 2026 als &amp;quot;Efficiency King&amp;quot;.&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Installation:&amp;#039;&amp;#039;&amp;#039; Empfohlen wird die Nutzung von Python mit `uv` oder einer Standard-Umgebung. Als Systemabhängigkeit wird oft `espeak-ng` benötigt.&lt;br /&gt;
&amp;lt;pre&amp;gt;&lt;br /&gt;
sudo apt-get install espeak-ng -y&lt;br /&gt;
pip install uv&lt;br /&gt;
uv init -p 3.12&lt;br /&gt;
uv add kokoro-onnx soundfile&lt;br /&gt;
&amp;lt;/pre&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== Fish Speech / CosyVoice ===&lt;br /&gt;
Diese Modelle richten sich an Nutzer mit leistungsstarker Hardware und stellen den aktuellen State-of-the-Art dar.&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Fish Speech (z.B. V1.5):&amp;#039;&amp;#039;&amp;#039; Ein extrem hochwertiges, mehrsprachiges Modell (inkl. Deutsch, Englisch, Chinesisch). Es basiert auf modernen Transformern (DualAR). &amp;#039;&amp;#039;&amp;#039;Wichtig:&amp;#039;&amp;#039;&amp;#039; Benötigt zwingend eine performante NVIDIA-GPU für vernünftige Geschwindigkeiten.&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;CosyVoice (z.B. V2):&amp;#039;&amp;#039;&amp;#039; Von FunAudioLLM entwickelt. Es ist hervorragend für Streaming und interaktive Voice-Assistenten geeignet, da es sehr niedrige Latenzen (ca. 150ms) erreicht. Auch hier ist eine GPU stark empfohlen.&lt;br /&gt;
&lt;br /&gt;
=== Weitere TTS-Sprachmodelle ===&lt;br /&gt;
Neben den genannten Favoriten gibt es weitere bemerkenswerte Open-Source-Modelle:&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Bark / ChatTTS:&amp;#039;&amp;#039;&amp;#039; Bekannt für die Generierung von nicht-sprachlichen Geräuschen (Lachen, Seufzen) und sehr expressivem, emotionalem Dialog.&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;Parler-TTS:&amp;#039;&amp;#039;&amp;#039; Erlaubt die Steuerung der Stimme durch beschreibende Text-Prompts (z.B. &amp;quot;eine tiefe, langsame und hallende Stimme spricht&amp;quot;).&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;IndexTTS-2:&amp;#039;&amp;#039;&amp;#039; Stark für präzise Steuerung (z.B. genaue Länge des generierten Audios), sehr nützlich für Video-Dubbing.&lt;br /&gt;
&lt;br /&gt;
== Hardware-Anforderungen ==&lt;br /&gt;
&lt;br /&gt;
=== Wie viel RAM (Arbeitsspeicher) wird benötigt? ===&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;8 GB RAM:&amp;#039;&amp;#039;&amp;#039; Das absolute Minimum. Reicht aus für kleine CPU-basierte Modelle wie Piper TTS oder Kokoro, wenn keine anderen speicherhungrigen Programme parallel laufen.&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;16 GB RAM:&amp;#039;&amp;#039;&amp;#039; Empfohlen für Standard-Anwendungen und gelegentliche KI-Nutzung.&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;32 GB RAM (oder mehr):&amp;#039;&amp;#039;&amp;#039; Dringend empfohlen für den reibungslosen Betrieb von großen Systemen (wie Fish Speech), insbesondere wenn Modelle geladen oder Daten verarbeitet werden.&lt;br /&gt;
&lt;br /&gt;
=== Wie viel VRAM (Videospeicher der Grafikkarte) benötigt mein Rechner? ===&lt;br /&gt;
Der VRAM ist für KI-Anwendungen der wichtigste Engpass.&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;0 GB VRAM (Nur CPU):&amp;#039;&amp;#039;&amp;#039; Ausreichend für Piper TTS und Kokoro-ONNX. Die Generierung dauert minimal länger, ist aber in der Praxis (besonders bei Kokoro) oft ausreichend schnell.&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;8 GB VRAM:&amp;#039;&amp;#039;&amp;#039; Reicht für kleine bis mittlere GPU-Modelle. Kann bei sehr großen TTS-Modellen zu &amp;quot;Out-Of-Memory&amp;quot; (OOM) Fehlern führen.&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;12 - 16 GB VRAM (z.B. RTX 4070/4080):&amp;#039;&amp;#039;&amp;#039; Das empfohlene Minimum für anspruchsvolle Modelle wie Fish Speech oder CosyVoice, um diese schnell und ohne Abstürze zu betreiben.&lt;br /&gt;
* &amp;#039;&amp;#039;&amp;#039;24 GB VRAM (z.B. RTX 3090/4090):&amp;#039;&amp;#039;&amp;#039; Ideal für das schnelle Ausführen (&amp;quot;Inference&amp;quot;) modernster Modelle in höchster Qualität und Grundvoraussetzung, falls man Modelle selbst trainieren (&amp;quot;Fine-Tuning&amp;quot;) möchte.&lt;br /&gt;
&lt;br /&gt;
== Wie installiert man Software auf einem Ubuntu-Rechner? ==&lt;br /&gt;
&lt;br /&gt;
Im Folgenden werden die grundlegenden Schritte zur Installation von typischer (KI-)Software auf einem modernen Ubuntu 26.04 Rechner erklärt.&lt;br /&gt;
&lt;br /&gt;
=== 1. Systempakete aktualisieren ===&lt;br /&gt;
Vor jeder Installation sollten die internen Paketquellen (APT) auf den neuesten Stand gebracht werden:&lt;br /&gt;
&amp;lt;pre&amp;gt;&lt;br /&gt;
sudo apt update&lt;br /&gt;
sudo apt upgrade -y&lt;br /&gt;
&amp;lt;/pre&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== 2. System-Abhängigkeiten installieren ===&lt;br /&gt;
Die meisten KI- und Audioprojekte benötigen grundlegende Compiler und Werkzeuge:&lt;br /&gt;
&amp;lt;pre&amp;gt;&lt;br /&gt;
sudo apt install build-essential git ffmpeg python3-pip python3-venv -y&lt;br /&gt;
&amp;lt;/pre&amp;gt;&lt;br /&gt;
* &amp;lt;code&amp;gt;git&amp;lt;/code&amp;gt; wird benötigt, um den Quellcode von GitHub herunterzuladen.&lt;br /&gt;
* &amp;lt;code&amp;gt;ffmpeg&amp;lt;/code&amp;gt; ist der Standard zur Verarbeitung von Audio- und Videodateien.&lt;br /&gt;
&lt;br /&gt;
=== 3. Software von GitHub herunterladen (Klonen) ===&lt;br /&gt;
Viele Tools existieren nicht als fertiges Paket, sondern werden direkt über ihren Quellcode genutzt:&lt;br /&gt;
&amp;lt;pre&amp;gt;&lt;br /&gt;
git clone https://github.com/nutzername/projektname.git&lt;br /&gt;
cd projektname&lt;br /&gt;
&amp;lt;/pre&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== 4. Virtuelle Python-Umgebung erstellen ===&lt;br /&gt;
Da KI-Projekte oft sehr spezifische und teils inkompatible Versionen von Python-Bibliotheken benötigen, darf man diese &amp;#039;&amp;#039;&amp;#039;nie&amp;#039;&amp;#039;&amp;#039; systemweit installieren. Man nutzt virtuelle Umgebungen (venv).&lt;br /&gt;
&amp;lt;pre&amp;gt;&lt;br /&gt;
python3 -m venv .venv&lt;br /&gt;
source .venv/bin/activate&lt;br /&gt;
&amp;lt;/pre&amp;gt;&lt;br /&gt;
Das Präfix &amp;lt;code&amp;gt;(.venv)&amp;lt;/code&amp;gt; sollte nun im Terminal sichtbar sein.&lt;br /&gt;
&lt;br /&gt;
=== 5. Python-Abhängigkeiten installieren ===&lt;br /&gt;
In der aktivierten Umgebung werden nun die spezifischen Pakete (meist aus einer &amp;lt;code&amp;gt;requirements.txt&amp;lt;/code&amp;gt;) installiert:&lt;br /&gt;
&amp;lt;pre&amp;gt;&lt;br /&gt;
pip install -r requirements.txt&lt;br /&gt;
&amp;lt;/pre&amp;gt;&lt;br /&gt;
Alternativ nutzen moderne Projekte den extrem schnellen Paketmanager &amp;lt;code&amp;gt;uv&amp;lt;/code&amp;gt; (Installation via &amp;lt;code&amp;gt;pip install uv&amp;lt;/code&amp;gt;).&lt;br /&gt;
&lt;br /&gt;
=== 6. NVIDIA Treiber und CUDA (Optional) ===&lt;br /&gt;
Wenn eine NVIDIA-Grafikkarte vorhanden ist, installiert man in Ubuntu am einfachsten über die &amp;quot;Anwendungen &amp;amp; Aktualisierungen&amp;quot; -&amp;gt; &amp;quot;Zusätzliche Treiber&amp;quot; den empfohlenen proprietären (eigenentwickelten) NVIDIA-Treiber. Das dazugehörige CUDA-Toolkit kann meist direkt über Ubuntu oder als Paket (z.B. `nvidia-cuda-toolkit`) installiert werden.&lt;br /&gt;
&lt;br /&gt;
----&lt;br /&gt;
&amp;#039;&amp;#039;Hinweis: Diese Inhalte wurden mit Unterstützung von Künstlicher Intelligenz erstellt und redaktionell überprüft (Transparenzhinweis gemäß Art. 50 EU AI Act).&amp;#039;&amp;#039;&lt;/div&gt;</summary>
		<author><name>imported&gt;Import</name></author>
	</entry>
</feed>