Defuddle
Skill matvej-melikhov/karpathy-llm-wiki/.claude/skills/defuddle
Программная реализация паттерна LLM Wiki (А. Карпаты). ВКР СПбГЭТУ "ЛЭТИ" 2026
npx -y skills add matvej-melikhov/karpathy-llm-wiki --skill defuddleAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
2 things to look at
- 18 days oldThe repository was created 18 days ago. New is not bad, but a brand new repository carrying a familiar-sounding name is the shape a typosquat arrives in, and there has been no time for anyone else to find a problem with it.
- 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
What its author says it does
Copied from the file, not written here
Очистить веб-страницу от мусора (nav, ads, sidebar, footer) и вернуть дословный текст статьи как чистый markdown. Сохраняет картинки (как URL-ссылки) и формулы LaTeX. Используется в URL ingestion как единственный инструмент очистки. Триггеры: defuddle, clean this page, strip this url, fetch and clean, очисти страницу, выгрузи статью, читаемый markdown из URL.
SKILL.md
3.9 KB, 875 tokens by cl100k_base, as published. Nobody here has run it
defuddle: очистка веб-страниц
defuddle — CLI-утилита (от kepano, автор Obsidian Minimal theme и Web Clipper). На базе Mozilla Readability + кастомные чистильщики.
Что делает:
- Принимает URL или локальный HTML
- Возвращает дословный текст статьи в markdown
- Сохраняет: текст, заголовки, списки, таблицы, code blocks, формулы LaTeX (
$...$,$$...$$), ссылки на картинки () - Удаляет: nav, sidebar, ads, cookie banners, footer, share-кнопки, related articles, скрипты, стили
Что НЕ делает: не суммаризирует, не перефразирует, не интерпретирует. Чистый strip + конвертация HTML → markdown.
Установка (зависимость проекта)
npm install -g defuddle
Проверка: defuddle --version (требуется 0.18.x или новее).
defuddle входит в обязательные зависимости проекта — без него URL ingestion не работает. Зависимость от Node.js / npm.
Использование
Очистить URL и получить markdown
defuddle parse https://example.com/article --markdown
Выводит markdown в stdout.
Сохранить в raw/articles/ с frontmatter
Полный flow для URL ingestion:
URL="https://example.com/article"
SLUG="article-slug"
DATE=$(date +%Y-%m-%d)
DEST="raw/articles/${SLUG}-${DATE}.md"
mkdir -p raw/articles
{
echo "---"
echo "source_url: ${URL}"
echo "fetched: ${DATE}"
echo "---"
echo ""
defuddle parse "${URL}" --markdown
} > "${DEST}"
После сохранения файл готов для synthesis workflow.
Очистить локальный HTML
defuddle parse page.html --markdown
Извлечь только метаданные
defuddle parse "${URL}" --json
Выводит JSON с полями: title, description, author, published, content. Полезно для авто-заполнения frontmatter.
Когда использовать
Да:
- Любой URL ingestion (статья, блог-пост, документация)
- Длинные тексты с обилием обвеса (Medium, Substack, news-сайты)
- Когда хочется дословный текст автора, а не суммаризацию
Нет:
- Источник уже чистый markdown или PDF
- Страница — dashboard / SPA / структурированные данные (defuddle ожидает article-style)
- Сайт за anti-bot защитой (defuddle не обходит CAPTCHA / JS-challenges)
Интеграция с ingest
Скилл ingest вызывает defuddle автоматически при URL ingestion. См. секцию "URL ingestion" в .claude/skills/ingest/SKILL.md.
Вручную скачать страницу и затем ingestить:
defuddle parse "${URL}" --markdown > "raw/articles/${SLUG}-$(date +%Y-%m-%d).md"
# затем:
# /ingest raw/articles/${SLUG}-${DATE}.md
What ships with it
Read from the repository
Just SKILL.md. No reference files, no scripts.