einfachskills_

Automatisierung

Blog Audio (Gemini TTS Vertonung)

Vertont Blogartikel per Google Gemini TTS als Summary, Vollartikel oder Zwei-Sprecher-Podcast

Dieser Skill wandelt Blogbeiträge in gesprochene Audioversionen um und nutzt dafür Google Gemini TTS. Er unterstützt drei Modi: eine kompakte gesprochene Zusammenfassung, das vollständige Vorlesen des Artikels oder ein zweistimmiges Podcast-Dialogformat mit Host und Experte. Aus über 30 Stimmen in mehr als 80 Sprachen wird passend zum Inhaltstyp eine Empfehlung ausgesprochen, etwa informativ für Sachartikel oder freundlich für Tutorials. Claude bereitet den Text jeweils selbst für die Sprachausgabe auf – Markdown wird entfernt, Überschriften werden zu natürlichen Übergängen, Codeblöcke werden verbal beschrieben – bevor das eigentliche TTS-Skript nur noch die Audioerzeugung übernimmt.

Der Skill lässt sich eigenständig über einen Slash-Befehl aufrufen oder intern aus einem Blog-Schreib-Workflow heraus nutzen, wobei er bei fehlendem API-Key stillschweigend übersprungen wird, ohne den restlichen Workflow zu blockieren. Ausgegeben wird eine MP3-Datei samt fertigem HTML5-Audio-Embed-Code für gängige Systeme wie Hugo, Jekyll, Next.js oder WordPress. Vorausgesetzt werden Python 3.11+, ein Google-AI-API-Key sowie optional FFmpeg für die MP3-Konvertierung. Da die ausführenden Skripte (run.py, generate_audio.py) und die Stimmen-Referenzdatei nicht Teil der geprüften SKILL.md sind, lässt sich das tatsächliche Laufzeitverhalten hinsichtlich Netzwerkzugriffen und Dateioperationen nicht vollständig verifizieren.


FAQ

Häufige Fragen zu Blog Audio (Gemini TTS Vertonung)

Welche Voraussetzungen müssen erfüllt sein, damit der Skill funktioniert?
Benötigt werden Python 3.11+, ein Google-AI-API-Key (über die Umgebungsvariable GOOGLE_AI_API_KEY, derselbe Key wie bei blog-image genutzt werden kann) sowie optional FFmpeg für die Umwandlung von WAV zu MP3. Ist FFmpeg nicht installiert, wird laut SKILL.md stattdessen eine WAV-Datei ausgegeben.
Was passiert, wenn kein API-Key konfiguriert ist?
Bei eigenständigem Aufruf über den Slash-Befehl leitet der Skill zur Erstellung eines kostenlosen Keys unter aistudio.google.com/apikey an. Wird der Skill dagegen intern aus einem Blog-Schreib-Workflow heraus aufgerufen, kehrt er bei fehlendem Key stillschweigend ohne Fehler zurück, damit der restliche Workflow nicht blockiert wird.
Entstehen Kosten bei der Nutzung, und wie hoch sind sie?
Die Audioerzeugung läuft über die Google Gemini TTS API, die kostenpflichtig ist (separat vom Skill selbst, abhängig vom gewählten Modell wie flash oder pro). Laut SKILL.md liefert der Skill nach der Generierung eine geschätzte Kostenangabe mit, konkrete Preisdetails oder Freikontingente sind in der geprüften Datei jedoch nicht genannt.
Für welche Blog-Systeme eignet sich der erzeugte Audio-Embed-Code?
Der Skill liefert HTML5-Audio-Embed-Code für statische Seiten (Hugo, Jekyll), MDX-basierte Frameworks (Next.js, Gatsby) sowie einen WordPress-Shortcode. Die Platzierung im Artikel (z.B. nach der Einleitung oder oben mit Label "Audio version") wird als Vorschlag mitgeliefert, die Einbindung selbst muss manuell in das jeweilige System erfolgen.

Verwandt

Weitere Skills aus Automatisierung