Transkription
Portable SKILL.md library for Claude Code, Codex-compatible agents, BACH, and local-first LLM workflows
npx -y skills add ellmos-ai/skills --skill transkriptionAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
One thing to look at
- 2 stars2 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
What its author says it does
Copied from the file, not written here
Transkribiert Audio-/Video-Dateien in Text. Nutzt Whisper (openai-whisper) oder Vosk (offline) als optionales Backend — beide werden per Presence-Check erkannt. Ohne Backend: Platzhalter-Modus mit Dummy-Ausgabe (Dry-Run).
SKILL.md
5.3 KB, as published. Nobody here has run it
Zweck
Audio-/Video-Dateien in Text umwandeln — lokal, ohne Cloud-Pflicht. Der Skill erkennt selbst, ob Whisper oder Vosk installiert ist, und wählt das beste verfügbare Backend. Ohne Backend läuft er im Dry-Run-Modus und gibt einen Platzhaltertext zurück, sodass der Workflow immer funktioniert.
Transkripte werden lokal in transkription/store.db gespeichert und können
abgefragt werden.
Trigger
| Phrase | Aktion |
|---|---|
| „Transkribiere diese Audio" | Audio-Datei transkribieren |
| „Transkribiere [Datei]" | Benannte Datei transkribieren |
| „Zeig meine Transkripte" | Letzte Transkripte auflisten |
| „Suche Transkript [Begriff]" | Volltextsuche in Transkripten |
| „Exportiere Transkript [ID]" | Transkript als TXT exportieren |
Workflow
- Backend-Check: Prüfen ob
whisperodervoskimportierbar ist. - Datei-Prüfung: Eingabedatei muss existieren (Audio: wav, mp3, m4a, ogg, flac; Video: mp4, mkv, webm — Extraktion via ffmpeg).
- Transkription: Backend aufrufen und Rohtext erhalten.
- Speichern: Ergebnis mit Metadaten (Datei, Dauer, Sprache, Backend, Zeitstempel) in
store.db. - Ausgabe: Text zurückgeben; optional als
.txtexportieren.
CLI-Einstieg
# Datei transkribieren
python transkription_core.py transcribe audio.wav
# Mit expliziter Sprache
python transkription_core.py transcribe audio.mp3 --lang de
# Dry-Run (kein Backend nötig)
python transkription_core.py transcribe audio.wav --dry-run
# Transkripte auflisten
python transkription_core.py list [--limit 20]
# Volltextsuche
python transkription_core.py search "Begriff"
# Exportieren
python transkription_core.py export <id> [--out datei.txt]
# Backend-Check
python transkription_core.py check
# Alternativer Store-Pfad (z.B. für Tests)
python transkription_core.py --store /tmp/test.db transcribe audio.wav --dry-run
Store
| Eigenschaft | Wert |
|---|---|
| Typ | SQLite |
| Pfad (Standard) | skills/assist/transkription/store.db |
| Override | --store <pfad> oder Env TRANSKRIPTION_STORE |
| Tabellen | transcripts |
Schema transcripts
CREATE TABLE IF NOT EXISTS transcripts (
id TEXT PRIMARY KEY, -- UUID (kurz: 8 Hex)
file_path TEXT NOT NULL, -- Originalpfad der Audiodatei
file_name TEXT NOT NULL, -- Dateiname (ohne Pfad, für Anzeige)
text TEXT NOT NULL, -- Transkribierter Text
language TEXT, -- Sprache (z.B. "de", "en")
backend TEXT, -- "whisper" | "vosk" | "dry-run"
duration_s REAL, -- Dauer in Sekunden (wenn bekannt)
created_at TEXT NOT NULL, -- ISO-8601 Timestamp
tags TEXT -- Komma-getrennte Tags (optional)
);
Haltung
- Ohne installiertes Backend funktioniert der Skill im Dry-Run-Modus (Demo-Text).
- Whisper wird gegenüber Vosk bevorzugt (bessere Deutsch-Qualität).
- Die Wahl zwischen Whisper und Vosk kann per
assist/prefs.json(transkription_backend: "whisper"|"vosk"|"auto") festgelegt werden. - ffmpeg für Video-Extraktion wird separat benötigt und ist nicht im Skill enthalten.
Datenschutz
- Alle Transkripte bleiben lokal — keine Cloud-Übertragung ohne Whisper-Online-Modus.
- Whisper kann lokal (tiny/base/medium-Modell) oder über OpenAI-API genutzt werden. Standardmäßig wird das lokale Modell verwendet.
store.dbenthält potenziell sensible Gesprächsinhalte — nicht in Git committen.- Empfehlung:
.gitignoreumstore.dbergänzen.
Verwandte Ressourcen
- BACH
hub/_services/voice/voice_stt.py— Backend-Muster (Inspiration, read-only) - Skill
utilities/yt-transcriber— YouTube-Transkription (separater Skill, kein Duplikat: YT-spezifisch) tools/module-installer/module_installer.py— Registry enthält whisper + vosk
Changelog
| Version | Datum | Änderung |
|---|---|---|
| 0.1.0 | 2026-06-22 | Erstanlage — eigener SQLite-Store, Whisper/Vosk-Presence-Check |