agentsclimarketplace

Defuddle

Skill matvej-melikhov/karpathy-llm-wiki/.claude/skills/defuddle

Программная реализация паттерна LLM Wiki (А. Карпаты). ВКР СПбГЭТУ "ЛЭТИ" 2026

Install
npx -y skills add matvej-melikhov/karpathy-llm-wiki --skill defuddle

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

2 things to look at

  • 18 days oldThe repository was created 18 days ago. New is not bad, but a brand new repository carrying a familiar-sounding name is the shape a typosquat arrives in, and there has been no time for anyone else to find a problem with it.
  • 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

What its author says it does

Copied from the file, not written here

Очистить веб-страницу от мусора (nav, ads, sidebar, footer) и вернуть дословный текст статьи как чистый markdown. Сохраняет картинки (как URL-ссылки) и формулы LaTeX. Используется в URL ingestion как единственный инструмент очистки. Триггеры: defuddle, clean this page, strip this url, fetch and clean, очисти страницу, выгрузи статью, читаемый markdown из URL.

SKILL.md

3.9 KB, 875 tokens by cl100k_base, as published. Nobody here has run it

defuddle: очистка веб-страниц

defuddle — CLI-утилита (от kepano, автор Obsidian Minimal theme и Web Clipper). На базе Mozilla Readability + кастомные чистильщики.

Что делает:

  • Принимает URL или локальный HTML
  • Возвращает дословный текст статьи в markdown
  • Сохраняет: текст, заголовки, списки, таблицы, code blocks, формулы LaTeX ($...$, $$...$$), ссылки на картинки (![alt](url))
  • Удаляет: nav, sidebar, ads, cookie banners, footer, share-кнопки, related articles, скрипты, стили

Что НЕ делает: не суммаризирует, не перефразирует, не интерпретирует. Чистый strip + конвертация HTML → markdown.


Установка (зависимость проекта)

npm install -g defuddle

Проверка: defuddle --version (требуется 0.18.x или новее).

defuddle входит в обязательные зависимости проекта — без него URL ingestion не работает. Зависимость от Node.js / npm.


Использование

Очистить URL и получить markdown

defuddle parse https://example.com/article --markdown

Выводит markdown в stdout.

Сохранить в raw/articles/ с frontmatter

Полный flow для URL ingestion:

URL="https://example.com/article"
SLUG="article-slug"
DATE=$(date +%Y-%m-%d)
DEST="raw/articles/${SLUG}-${DATE}.md"

mkdir -p raw/articles
{
  echo "---"
  echo "source_url: ${URL}"
  echo "fetched: ${DATE}"
  echo "---"
  echo ""
  defuddle parse "${URL}" --markdown
} > "${DEST}"

После сохранения файл готов для synthesis workflow.

Очистить локальный HTML

defuddle parse page.html --markdown

Извлечь только метаданные

defuddle parse "${URL}" --json

Выводит JSON с полями: title, description, author, published, content. Полезно для авто-заполнения frontmatter.


Когда использовать

Да:

  • Любой URL ingestion (статья, блог-пост, документация)
  • Длинные тексты с обилием обвеса (Medium, Substack, news-сайты)
  • Когда хочется дословный текст автора, а не суммаризацию

Нет:

  • Источник уже чистый markdown или PDF
  • Страница — dashboard / SPA / структурированные данные (defuddle ожидает article-style)
  • Сайт за anti-bot защитой (defuddle не обходит CAPTCHA / JS-challenges)

Интеграция с ingest

Скилл ingest вызывает defuddle автоматически при URL ingestion. См. секцию "URL ingestion" в .claude/skills/ingest/SKILL.md.

Вручную скачать страницу и затем ingestить:

defuddle parse "${URL}" --markdown > "raw/articles/${SLUG}-$(date +%Y-%m-%d).md"
# затем:
# /ingest raw/articles/${SLUG}-${DATE}.md

What ships with it

Read from the repository

Just SKILL.md. No reference files, no scripts.

Keep looking

Skills are one crate of 328,083. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.