agentsclimarketplace

Transkription

Skill ellmos-ai/skills/skills/assist/transkription

Portable SKILL.md library for Claude Code, Codex-compatible agents, BACH, and local-first LLM workflows

Install
npx -y skills add ellmos-ai/skills --skill transkription

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

One thing to look at

  • 2 stars2 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

What its author says it does

Copied from the file, not written here

Transkribiert Audio-/Video-Dateien in Text. Nutzt Whisper (openai-whisper) oder Vosk (offline) als optionales Backend — beide werden per Presence-Check erkannt. Ohne Backend: Platzhalter-Modus mit Dummy-Ausgabe (Dry-Run).

SKILL.md

5.3 KB, as published. Nobody here has run it

Zweck

Audio-/Video-Dateien in Text umwandeln — lokal, ohne Cloud-Pflicht. Der Skill erkennt selbst, ob Whisper oder Vosk installiert ist, und wählt das beste verfügbare Backend. Ohne Backend läuft er im Dry-Run-Modus und gibt einen Platzhaltertext zurück, sodass der Workflow immer funktioniert.

Transkripte werden lokal in transkription/store.db gespeichert und können abgefragt werden.


Trigger

PhraseAktion
„Transkribiere diese Audio"Audio-Datei transkribieren
„Transkribiere [Datei]"Benannte Datei transkribieren
„Zeig meine Transkripte"Letzte Transkripte auflisten
„Suche Transkript [Begriff]"Volltextsuche in Transkripten
„Exportiere Transkript [ID]"Transkript als TXT exportieren

Workflow

  1. Backend-Check: Prüfen ob whisper oder vosk importierbar ist.
  2. Datei-Prüfung: Eingabedatei muss existieren (Audio: wav, mp3, m4a, ogg, flac; Video: mp4, mkv, webm — Extraktion via ffmpeg).
  3. Transkription: Backend aufrufen und Rohtext erhalten.
  4. Speichern: Ergebnis mit Metadaten (Datei, Dauer, Sprache, Backend, Zeitstempel) in store.db.
  5. Ausgabe: Text zurückgeben; optional als .txt exportieren.

CLI-Einstieg

# Datei transkribieren
python transkription_core.py transcribe audio.wav

# Mit expliziter Sprache
python transkription_core.py transcribe audio.mp3 --lang de

# Dry-Run (kein Backend nötig)
python transkription_core.py transcribe audio.wav --dry-run

# Transkripte auflisten
python transkription_core.py list [--limit 20]

# Volltextsuche
python transkription_core.py search "Begriff"

# Exportieren
python transkription_core.py export <id> [--out datei.txt]

# Backend-Check
python transkription_core.py check

# Alternativer Store-Pfad (z.B. für Tests)
python transkription_core.py --store /tmp/test.db transcribe audio.wav --dry-run

Store

EigenschaftWert
TypSQLite
Pfad (Standard)skills/assist/transkription/store.db
Override--store <pfad> oder Env TRANSKRIPTION_STORE
Tabellentranscripts

Schema transcripts

CREATE TABLE IF NOT EXISTS transcripts (
    id          TEXT PRIMARY KEY,  -- UUID (kurz: 8 Hex)
    file_path   TEXT NOT NULL,     -- Originalpfad der Audiodatei
    file_name   TEXT NOT NULL,     -- Dateiname (ohne Pfad, für Anzeige)
    text        TEXT NOT NULL,     -- Transkribierter Text
    language    TEXT,              -- Sprache (z.B. "de", "en")
    backend     TEXT,              -- "whisper" | "vosk" | "dry-run"
    duration_s  REAL,              -- Dauer in Sekunden (wenn bekannt)
    created_at  TEXT NOT NULL,     -- ISO-8601 Timestamp
    tags        TEXT               -- Komma-getrennte Tags (optional)
);

Haltung

  • Ohne installiertes Backend funktioniert der Skill im Dry-Run-Modus (Demo-Text).
  • Whisper wird gegenüber Vosk bevorzugt (bessere Deutsch-Qualität).
  • Die Wahl zwischen Whisper und Vosk kann per assist/prefs.json (transkription_backend: "whisper"|"vosk"|"auto") festgelegt werden.
  • ffmpeg für Video-Extraktion wird separat benötigt und ist nicht im Skill enthalten.

Datenschutz

  • Alle Transkripte bleiben lokal — keine Cloud-Übertragung ohne Whisper-Online-Modus.
  • Whisper kann lokal (tiny/base/medium-Modell) oder über OpenAI-API genutzt werden. Standardmäßig wird das lokale Modell verwendet.
  • store.db enthält potenziell sensible Gesprächsinhalte — nicht in Git committen.
  • Empfehlung: .gitignore um store.db ergänzen.

Verwandte Ressourcen

  • BACH hub/_services/voice/voice_stt.py — Backend-Muster (Inspiration, read-only)
  • Skill utilities/yt-transcriber — YouTube-Transkription (separater Skill, kein Duplikat: YT-spezifisch)
  • tools/module-installer/module_installer.py — Registry enthält whisper + vosk

Changelog

VersionDatumÄnderung
0.1.02026-06-22Erstanlage — eigener SQLite-Store, Whisper/Vosk-Presence-Check

Keep looking

Skills are one crate of 328,083. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.