Transkription
Transkribiert Audio-/Video-Dateien in Text. Nutzt Whisper (openai-whisper) oder Vosk (offline) als optionales Backend — beide werden per Presence-Check erkannt. Ohne Backend: Platzhalter-Modus mit Dummy-Ausgabe (Dry-Run).From its SKILL.md
npx -y skills add ellmos-ai/skills --skill transkriptionAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
3 things to look at
- reads credentialsReads from 1 credential source: `TRANSKRIPTION_STORE`.
- 3 stars3 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
- runs commandsInstructs the agent to run 8 commands, including `python transkription_core.py transcribe audio.wav` and 7 more.
SKILL.md
5.3 KB, ~1.2k tokens by cl100k_base, as published. Nobody here has run it
Zweck
Audio-/Video-Dateien in Text umwandeln — lokal, ohne Cloud-Pflicht. Der Skill erkennt selbst, ob Whisper oder Vosk installiert ist, und wählt das beste verfügbare Backend. Ohne Backend läuft er im Dry-Run-Modus und gibt einen Platzhaltertext zurück, sodass der Workflow immer funktioniert.
Transkripte werden lokal in transkription/store.db gespeichert und können
abgefragt werden.
Trigger
| Phrase | Aktion |
|---|---|
| „Transkribiere diese Audio" | Audio-Datei transkribieren |
| „Transkribiere [Datei]" | Benannte Datei transkribieren |
| „Zeig meine Transkripte" | Letzte Transkripte auflisten |
| „Suche Transkript [Begriff]" | Volltextsuche in Transkripten |
| „Exportiere Transkript [ID]" | Transkript als TXT exportieren |
Workflow
- Backend-Check: Prüfen ob
whisperodervoskimportierbar ist. - Datei-Prüfung: Eingabedatei muss existieren (Audio: wav, mp3, m4a, ogg, flac; Video: mp4, mkv, webm — Extraktion via ffmpeg).
- Transkription: Backend aufrufen und Rohtext erhalten.
- Speichern: Ergebnis mit Metadaten (Datei, Dauer, Sprache, Backend, Zeitstempel) in
store.db. - Ausgabe: Text zurückgeben; optional als
.txtexportieren.
CLI-Einstieg
# Datei transkribieren
python transkription_core.py transcribe audio.wav
# Mit expliziter Sprache
python transkription_core.py transcribe audio.mp3 --lang de
# Dry-Run (kein Backend nötig)
python transkription_core.py transcribe audio.wav --dry-run
# Transkripte auflisten
python transkription_core.py list [--limit 20]
# Volltextsuche
python transkription_core.py search "Begriff"
# Exportieren
python transkription_core.py export <id> [--out datei.txt]
# Backend-Check
python transkription_core.py check
# Alternativer Store-Pfad (z.B. für Tests)
python transkription_core.py --store /tmp/test.db transcribe audio.wav --dry-run
Store
| Eigenschaft | Wert |
|---|---|
| Typ | SQLite |
| Pfad (Standard) | skills/assist/transkription/store.db |
| Override | --store <pfad> oder Env TRANSKRIPTION_STORE |
| Tabellen | transcripts |
Schema transcripts
CREATE TABLE IF NOT EXISTS transcripts (
id TEXT PRIMARY KEY, -- UUID (kurz: 8 Hex)
file_path TEXT NOT NULL, -- Originalpfad der Audiodatei
file_name TEXT NOT NULL, -- Dateiname (ohne Pfad, für Anzeige)
text TEXT NOT NULL, -- Transkribierter Text
language TEXT, -- Sprache (z.B. "de", "en")
backend TEXT, -- "whisper" | "vosk" | "dry-run"
duration_s REAL, -- Dauer in Sekunden (wenn bekannt)
created_at TEXT NOT NULL, -- ISO-8601 Timestamp
tags TEXT -- Komma-getrennte Tags (optional)
);
Haltung
- Ohne installiertes Backend funktioniert der Skill im Dry-Run-Modus (Demo-Text).
- Whisper wird gegenüber Vosk bevorzugt (bessere Deutsch-Qualität).
- Die Wahl zwischen Whisper und Vosk kann per
assist/prefs.json(transkription_backend: "whisper"|"vosk"|"auto") festgelegt werden. - ffmpeg für Video-Extraktion wird separat benötigt und ist nicht im Skill enthalten.
Datenschutz
- Alle Transkripte bleiben lokal — keine Cloud-Übertragung ohne Whisper-Online-Modus.
- Whisper kann lokal (tiny/base/medium-Modell) oder über OpenAI-API genutzt werden. Standardmäßig wird das lokale Modell verwendet.
store.dbenthält potenziell sensible Gesprächsinhalte — nicht in Git committen.- Empfehlung:
.gitignoreumstore.dbergänzen.
Verwandte Ressourcen
- BACH
hub/_services/voice/voice_stt.py— Backend-Muster (Inspiration, read-only) - Skill
utilities/yt-transcriber— YouTube-Transkription (separater Skill, kein Duplikat: YT-spezifisch) tools/module-installer/module_installer.py— Registry enthält whisper + vosk
Changelog
| Version | Datum | Änderung |
|---|---|---|
| 0.1.0 | 2026-06-22 | Erstanlage — eigener SQLite-Store, Whisper/Vosk-Presence-Check |
What ships with it: 8 files
567.0 KB alongside SKILL.md, 1 of them executable
- banner.png519.2 KB
- SKILL.en.md5.3 KB
- SKILL.es.md5.8 KB
- SKILL.fr.md4.2 KB
- SKILL.ja.md6.5 KB
- SKILL.ru.md7.3 KB
- SKILL.zh.md5.4 KB
- transkription_core.pyruns13.3 KB