agentsclimarketplace

Transkription

Skill ellmos-ai/skills/skills/assist/transkription

Transkribiert Audio-/Video-Dateien in Text. Nutzt Whisper (openai-whisper) oder Vosk (offline) als optionales Backend — beide werden per Presence-Check erkannt. Ohne Backend: Platzhalter-Modus mit Dummy-Ausgabe (Dry-Run).From its SKILL.md

Install
npx -y skills add ellmos-ai/skills --skill transkription

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

3 things to look at

  • reads credentialsReads from 1 credential source: `TRANSKRIPTION_STORE`.
  • 3 stars3 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
  • runs commandsInstructs the agent to run 8 commands, including `python transkription_core.py transcribe audio.wav` and 7 more.

SKILL.md

5.3 KB, ~1.2k tokens by cl100k_base, as published. Nobody here has run it

Zweck

Audio-/Video-Dateien in Text umwandeln — lokal, ohne Cloud-Pflicht. Der Skill erkennt selbst, ob Whisper oder Vosk installiert ist, und wählt das beste verfügbare Backend. Ohne Backend läuft er im Dry-Run-Modus und gibt einen Platzhaltertext zurück, sodass der Workflow immer funktioniert.

Transkripte werden lokal in transkription/store.db gespeichert und können abgefragt werden.


Trigger

PhraseAktion
„Transkribiere diese Audio"Audio-Datei transkribieren
„Transkribiere [Datei]"Benannte Datei transkribieren
„Zeig meine Transkripte"Letzte Transkripte auflisten
„Suche Transkript [Begriff]"Volltextsuche in Transkripten
„Exportiere Transkript [ID]"Transkript als TXT exportieren

Workflow

  1. Backend-Check: Prüfen ob whisper oder vosk importierbar ist.
  2. Datei-Prüfung: Eingabedatei muss existieren (Audio: wav, mp3, m4a, ogg, flac; Video: mp4, mkv, webm — Extraktion via ffmpeg).
  3. Transkription: Backend aufrufen und Rohtext erhalten.
  4. Speichern: Ergebnis mit Metadaten (Datei, Dauer, Sprache, Backend, Zeitstempel) in store.db.
  5. Ausgabe: Text zurückgeben; optional als .txt exportieren.

CLI-Einstieg

# Datei transkribieren
python transkription_core.py transcribe audio.wav

# Mit expliziter Sprache
python transkription_core.py transcribe audio.mp3 --lang de

# Dry-Run (kein Backend nötig)
python transkription_core.py transcribe audio.wav --dry-run

# Transkripte auflisten
python transkription_core.py list [--limit 20]

# Volltextsuche
python transkription_core.py search "Begriff"

# Exportieren
python transkription_core.py export <id> [--out datei.txt]

# Backend-Check
python transkription_core.py check

# Alternativer Store-Pfad (z.B. für Tests)
python transkription_core.py --store /tmp/test.db transcribe audio.wav --dry-run

Store

EigenschaftWert
TypSQLite
Pfad (Standard)skills/assist/transkription/store.db
Override--store <pfad> oder Env TRANSKRIPTION_STORE
Tabellentranscripts

Schema transcripts

CREATE TABLE IF NOT EXISTS transcripts (
    id          TEXT PRIMARY KEY,  -- UUID (kurz: 8 Hex)
    file_path   TEXT NOT NULL,     -- Originalpfad der Audiodatei
    file_name   TEXT NOT NULL,     -- Dateiname (ohne Pfad, für Anzeige)
    text        TEXT NOT NULL,     -- Transkribierter Text
    language    TEXT,              -- Sprache (z.B. "de", "en")
    backend     TEXT,              -- "whisper" | "vosk" | "dry-run"
    duration_s  REAL,              -- Dauer in Sekunden (wenn bekannt)
    created_at  TEXT NOT NULL,     -- ISO-8601 Timestamp
    tags        TEXT               -- Komma-getrennte Tags (optional)
);

Haltung

  • Ohne installiertes Backend funktioniert der Skill im Dry-Run-Modus (Demo-Text).
  • Whisper wird gegenüber Vosk bevorzugt (bessere Deutsch-Qualität).
  • Die Wahl zwischen Whisper und Vosk kann per assist/prefs.json (transkription_backend: "whisper"|"vosk"|"auto") festgelegt werden.
  • ffmpeg für Video-Extraktion wird separat benötigt und ist nicht im Skill enthalten.

Datenschutz

  • Alle Transkripte bleiben lokal — keine Cloud-Übertragung ohne Whisper-Online-Modus.
  • Whisper kann lokal (tiny/base/medium-Modell) oder über OpenAI-API genutzt werden. Standardmäßig wird das lokale Modell verwendet.
  • store.db enthält potenziell sensible Gesprächsinhalte — nicht in Git committen.
  • Empfehlung: .gitignore um store.db ergänzen.

Verwandte Ressourcen

  • BACH hub/_services/voice/voice_stt.py — Backend-Muster (Inspiration, read-only)
  • Skill utilities/yt-transcriber — YouTube-Transkription (separater Skill, kein Duplikat: YT-spezifisch)
  • tools/module-installer/module_installer.py — Registry enthält whisper + vosk

Changelog

VersionDatumÄnderung
0.1.02026-06-22Erstanlage — eigener SQLite-Store, Whisper/Vosk-Presence-Check

What ships with it: 8 files

567.0 KB alongside SKILL.md, 1 of them executable

Keep looking

Skills are one crate of 325,949. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.