🧠 KI-Analyse
Gemini Text-Analyse
🎤 Mikrofoneinstellung testen
🗣️ Aussprache-Profil
Erlaubt der App, deine Aussprache zu lernen.
Wörter
❓ Hilfe
🪄 Auto-Format
Wandelt eingefügten Rohtext in Rolle/Dialog/Regieanweisung/Handlung/Szenenkopf um — läuft auch
automatisch nach jedem Einfügen. Ist ein Gemini-Schlüssel hinterlegt (unter „Text-Analyse“),
übernimmt Gemini das Einordnen — inhaltlich zuverlässiger bei uneindeutigem Text als die lokale
Regel-Erkennung. Nur Text in (Klammern) gilt dabei als Regieanweisung; unmarkierte
Handlungsbeschreibungen werden als stumme Handlung erkannt, nicht als Dialog gesprochen.
Schlägt Gemini fehl oder verändert den Text zu stark, springt automatisch die lokale
Erkennung ein — nie Netzwerkpflicht, nie Textverlust.
📄 PDF importieren
Erreichbar über „+ Neue Szene“ im Szenen-Bereich → „Aus PDF importieren“ — ein PDF-Import beginnt ja ohnehin eine neue Szene. Liest den Inhalt einer als PDF gespeicherten Szene ein und formatiert ihn automatisch per Auto-Format (siehe oben). Funktioniert komplett offline, ganz ohne Gemini-Schlüssel — dafür eigens gebaut, keine externe Bibliothek. Mit Gemini-Schlüssel wird stattdessen Gemini zum Lesen verwendet: zuverlässiger bei exotischen Schriften, und als einziger Weg auch bei gescannten PDFs ohne echte Textebene (Texterkennung). Ohne Schlüssel geht das nicht — das kann keine Offline-Lösung.
🔑 Gemini-Schlüssel erstellen
Mehrere Funktionen dieser App (Auto-Format bei uneindeutigem Text, PDF-Import bei gescannten Dateien, 🧠 KI-Analyse, Formulierungs-Alternativen für den Schlussbereich) nutzen optional Google Gemini. Ohne Schlüssel läuft alles andere unverändert weiter, nur diese vier Funktionen bleiben dann aus. Ein Schlüssel ist im Rahmen des kostenlosen Kontingents kostenlos.
- aistudio.google.com öffnen und mit einem Google-Konto anmelden.
- Oben links (oder im Menü) auf „Get API key“ bzw. „API-Schlüssel abrufen“ klicken.
- „Create API key“ bzw. „API-Schlüssel erstellen“ wählen — ein bestehendes Google-Cloud-Projekt auswählen oder automatisch eines erstellen lassen, falls gefragt.
- Den angezeigten Schlüssel kopieren.
- In dieser App unter „Text-Analyse“ in das Feld „Key“ einfügen und „Speichern“ klicken.
Der Schlüssel wird ausschließlich lokal in diesem Browser gespeichert und nirgendwo anders hin übertragen außer direkt an Google beim jeweiligen Aufruf.
🔑 ElevenLabs-Schlüssel erstellen
Natürlicher klingende Stimmen für die Partnerrollen (unter „Besetzung“ → „Externe Stimmen“) sind optional — ohne Schlüssel liest die App weiterhin mit den eingebauten Systemstimmen deines Mac vor. Ein ElevenLabs-Schlüssel ist im Rahmen des kostenlosen Kontingents kostenlos, keine Zahlungsmethode nötig.
- elevenlabs.io öffnen und ein Konto anlegen (dauert unter 2 Minuten).
- Oben rechts auf dein Profil-Symbol klicken, dann „API Keys“ bzw. „API-Schlüssel“ wählen (in manchen Ansichten unter den Workspace-Einstellungen zu finden).
- „Create API Key“ bzw. „API-Schlüssel erstellen“ wählen und einen Namen dafür vergeben.
- Den angezeigten Schlüssel sofort kopieren — er wird aus Sicherheitsgründen nur einmal angezeigt.
- In dieser App unter „Besetzung“ → „Externe Stimmen“ in das Feld „Key“ einfügen und „Laden“ klicken.
Der Schlüssel wird ausschließlich lokal in diesem Browser gespeichert und nirgendwo anders hin übertragen außer direkt an ElevenLabs beim jeweiligen Aufruf.
Zeilenmenü (⚙️)
Zeile anklicken, dann ⚙️: legt fest, ob eine Zeile Rolle, Dialog, Regieanweisung, stumme
Handlung oder Szenenkopf ist. Darunter 🎤 Stichwort einsprechen — falls die
Spracherkennung mit dem geschriebenen Text nicht gut zurechtkommt, kannst du das Zeilenende
stattdessen selbst vorsprechen, das wird dann als Erkennungsvorlage genutzt.
🔇 Auto-Weiter hier aus/an schaltet „Auto-Weiter bei Stille“ (siehe unten) gezielt für
genau diese Replik ab — nützlich, wenn du direkt vor einem der letzten Wörter bewusst eine
lange Pause machen willst. Markierte Zeilen bekommen ein 🔇-Symbol im Skript.
🔊 Replik selbst einsprechen
Ebenfalls im Zeilenmenü: nimmt deine eigene gesprochene Version dieser Zeile auf. Nützlich, um dir vorab anzuhören, wie du eine Replik sagen willst, oder um sie testweise zurückzuspielen — unabhängig von der computergenerierten TTS-Stimme.
Pausen im Text
Klammerangaben wie (3s) oder (3,5s) lösen eine Sprechpause der
angegebenen Länge aus — egal ob als eigene Regieanweisungszeile oder mitten in einer Replik
(z. B. „Warte… (1,5s) ich muss nachdenken.“). Wird beim Vorlesen als echte Pause
eingehalten und beim Sprechen der eigenen Zeilen von der Spracherkennung ignoriert, genau wie
jede andere Klammerangabe.
Emotionen
Kurze Klammerangaben (bis 4 Wörter) vor einer Replik steuern die Stimme. Erkannt werden u. a.
(wütend), (traurig), (glücklich), (ruhig),
(nachdenklich), (nervös), (ängstlich),
(überrascht), (sarkastisch), (zärtlich),
(angewidert), (verwirrt), (müde), (verlegen),
(hoffnungsvoll), (gelangweilt), (flüsternd),
(aufgeregt) — auf Deutsch, Englisch, Französisch, Italienisch und Spanisch.
Die drei Engines nutzen das unterschiedlich gut: ElevenLabs (Modell „eleven_v3“) erhält
das Wort direkt eingebettet im Text und kann damit auch mit Wörtern außerhalb dieser Liste
etwas anfangen — das ist die einzige Engine mit echter, praktisch unbegrenzter Bandbreite.
Google Cloud und System-Stimmen kennen nur die Wörter aus der Liste oben und
bilden sie grob über Tempo/Tonhöhe/Lautstärke nach; ein unbekanntes Wort ändert bei ihnen
schlicht nichts an der Stimme.
🧠 KI-Analyse
In erster Linie eine Schauspiel-Einschätzung für dich als Darsteller — sie fügt vor jeder
Replik eine möglichst treffende Regieanweisung ein, nicht nur die vier Grundgefühle, sondern
gezielt auch Nuancen wie (pensive) statt pauschal (sad). Zusätzlich
schlägt sie natürliche Sprechpausen INNERHALB einzelner Repliken vor (siehe „Pausen im
Text“ oben) — etwa ein Zögern, eine bewusste Stille vor einem schweren Wort, oder auch direkt VOR
dem ersten Wort einer Replik, wenn eine Figur erstmal reagieren muss, bevor sie zu sprechen
anfängt — und trägt sie direkt als (Xs) in den Dialogtext ein. Aus
Sicherheitsgründen nur bei Zeilen, die noch keine eigene Klammerangabe im Dialogtext enthalten.
Rührt darüber hinaus
nichts an: Szenenköpfe, Handlungszeilen und die bestehende Zeilenaufteilung bleiben
exakt so stehen, wie du sie geschrieben hast. Von Hand gesetzte Regieanweisungen werden nie
überschrieben. Da diese Regieanweisungen dieselben Klammerangaben von oben sind, steuern sie
ganz nebenbei auch die Stimmen, wenn du sie zum Vorlesen nutzt. Braucht einen eigenen,
kostenlosen Gemini-Schlüssel (siehe „🔑 Gemini-Schlüssel erstellen“ oben). Ein erneuter Klick
auf den Knopf macht die komplette letzte Änderung (Emotionen UND Pausen) wieder rückgängig und
stellt die vorherige Fassung her.
Formulierungs-Alternativen für den Schlussbereich
Beim Start einer Szene liest Gemini (falls ein Schlüssel hinterlegt ist) die ganze Szene und schlägt für die letzten Worte jeder Replik bis zu vier alternative Formulierungen vor — falls du beim Sprechen unbewusst umformulierst oder eine Redewendung anders sagst, erkennt die App das trotzdem. Läuft für alle Rollen, nicht nur deine eigene, falls du die Rolle später wechselst. Wird pro Textstelle gespeichert und nur bei tatsächlicher Textänderung neu abgefragt — nicht bei Reglern wie „Zwingend verstandene Stichwörter“. Braucht denselben Gemini-Schlüssel wie die KI-Analyse.
ElevenLabs-Cache
Jede bei ElevenLabs erzeugte Replik wird lokal gespeichert (Stimme + Text + Emotionswort als Schlüssel). Kommt exakt dieselbe Kombination noch einmal vor — z. B. bei jedem weiteren Probendurchlauf derselben Szene — wird sie aus dem Speicher abgespielt statt neu abgerufen. Ändert sich der Text oder die Emotion auch nur geringfügig, wird automatisch neu geholt.
Weitere Stimmen hinzufügen
ElevenLabs: im Besetzungs-Menü ganz unten „🔎 Weitere Stimmen suchen…“ wählen —
durchsucht die ElevenLabs-Stimmenbibliothek und fügt eine gewählte Stimme direkt zu deinem
Konto hinzu. Dafür braucht es einen eigenen ElevenLabs-Account mit eingetragenem API-Schlüssel
(unter „Besetzung“ → „Externe Stimmen“, siehe „🔑 ElevenLabs-Schlüssel erstellen“ oben) — ohne
Schlüssel erscheint diese Option gar nicht erst im Menü.
System (macOS): lässt sich nicht von dieser Seite aus installieren. Neue Stimmen gibt es
unter Systemeinstellungen → Bedienungshilfen → Gesprochener Inhalt → Systemstimme → Verwalten.
Dort auf Stufe „Premium“ oder „Erweitert“ achten — nur solche werden hier angezeigt.
Nach dem Herunterladen diese Seite neu laden.
🎙️ Aufnahme-Setup verbessern
Dieselben Tipps, die auch nach „🎤 Mikrofon testen“ → „Aufnahmesituation testen“ erscheinen — hier zum Nachlesen, ohne den Test extra durchlaufen zu müssen:
⚠️ Siri-Stimmen funktionieren nicht
Stimmen aus Systemeinstellungen → Siri & Spotlight sind für Siri selbst reserviert. macOS gibt sie an keine andere App weiter — sie tauchen deshalb nirgends in der Besetzung auf, egal wie oft du neu lädst. Das ist eine Sperre von Apple, kein Fehler dieser App. Lade Stimmen also immer über Bedienungshilfen herunter, nicht über Siri.