The catalog
325,949 rows, by stacks then stars
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-flash-lite-preview/stock-data-visualization/run2_d3-data-load Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-flash-lite-preview/stock-data-visualization/run2_d3-interactive-table Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-flash-lite-preview/temperature-simulation/run2_glm-calibration Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-flash-lite-preview/temperature-simulation/run2_netcdf-data-handling Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-flash-lite-preview/travel-planning/run2_data-analysis Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-flash-lite-preview/travel-planning/run2_itinerary-builder Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-flash-lite-preview/video-object-counting/run2_image-processing Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-flash-lite-preview/video-object-counting/run2_object-detection Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-flash-lite-preview/video-object-counting/run2_video-frame-extraction Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-flash-lite-preview/weighted-gdp-calculation/run2_xlsx-analysis Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run2 anthropic brand guidelines
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/anthropic-poster-design/run2_anthropic-brand-guidelines Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run2 matplotlib technical poster
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/anthropic-poster-design/run2_matplotlib-technical-poster Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run2 chinese poetry qiyan lvshi
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/chinese-poem-generator/run2_chinese-poetry-qiyan-lvshi Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/court-form-filling/run2_pdf_fill Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/dbscan-parameter-tuning/run2_custom-distance-metrics Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/dbscan-parameter-tuning/run2_parallel-processing Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/dbscan-parameter-tuning/run2_pareto-optimization Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/dependency-vulnerability-check/run2_csv-reporting Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/dependency-vulnerability-check/run2_cvss-extraction Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/dependency-vulnerability-check/run2_trivy-offline Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/earthquake-plate-calculation/run2_geojson_handling Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/earthquake-plate-calculation/run2_geopandas_projections Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/earthquake-plate-calculation/run2_geopandas_spatial_joins Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/enterprise-information-search/run2_json-data-extraction Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/financial-analysis/run2_13f-fund-search Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/financial-analysis/run2_13f-fund-summary Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/financial-analysis/run2_13f-holdings-comparison Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/financial-analysis/run2_13f-stock-search Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/fix-security-bug/run2_jackson-security Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/github-repo-analytics/run2_github-api-data-fetcher Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/nlp-paper-reproduction/run2_pytorch-simpo-loss Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/offer-letter-generator/run2_python-docx Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/organize-messy-files/run2_file-text-extraction Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/organize-messy-files/run2_keyword-classification Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/python-scala-translation/run2_python-scala-dataclass Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run2 python scala generics variance
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/python-scala-translation/run2_python-scala-generics-variance Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/python-scala-translation/run2_python-scala-json-circe Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run2 python scala union overloads
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/python-scala-translation/run2_python-scala-union-overloads Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/schedule-planning/run2_output-generator Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/schedule-planning/run2_pdf-parser Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/schedule-planning/run2_scheduler Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/stock-data-visualization/run2_d3-force-bubble-chart Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/temperature-simulation/run2_glm_calibration Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/temperature-simulation/run2_netcdf_rmse_evaluation Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/travel-planning/run2_data_parsing Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/travel-planning/run2_itinerary_generation Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/video-object-counting/run2_ffmpeg-extract Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/video-object-counting/run2_imagemagick-grayscale Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/video-object-counting/run2_object-counting Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/weighted-gdp-calculation/run2_excel-lookup Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/weighted-gdp-calculation/run2_excel-statistics Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b2-self-feedback-gemini-3.1-pro-preview/weighted-gdp-calculation/run2_excel-weighted-mean Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Generate Nova Technical Exploded View Poster
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/anthropic-poster-design/run3_Generate-Nova-Technical-Exploded-View-Poster Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Build Pinyin to Tone Reference Table for Classical Chinese Poetry
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/chinese-poem-generator/run3_Build-Pinyin-to-Tone-Reference-Table-for-Classical-Chinese-Poetry Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Compose Seven Character Regulated Verse Character by Character Using Anchors
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/chinese-poem-generator/run3_Compose-Seven-Character-Regulated-Verse-Character-by-Character-Using-Anchors Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Map Pattern for Seven Character Regulated Verse
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/chinese-poem-generator/run3_Map----Pattern-for-Seven-Character-Regulated-Verse Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Verify Rhyme Integrity in Modern Mandarin Finals
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/chinese-poem-generator/run3_Verify-Rhyme-Integrity-in-Modern-Mandarin-Finals Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Extract PDF Form Field Names
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/court-form-filling/run3_Extract-PDF-Form-Field-Names Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Fill California Small Claims Form SC 100
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/court-form-filling/run3_Fill-California-Small-Claims-Form-SC-100 Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 dbscan custom distance clustering
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/dbscan-parameter-tuning/run1_dbscan-custom-distance-clustering Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.