The catalog
325,949 rows, by stacks then stars
Run3 Track and Verify File Organization
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/organize-messy-files/run3_Track-and-Verify-File-Organization Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 python to scala translation fundamentals
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/python-scala-translation/run1_python-to-scala-translation-fundamentals Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 scala functional programming for data processing
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/python-scala-translation/run1_scala-functional-programming-for-data-processing Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 scala naming conventions and style
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/python-scala-translation/run1_scala-naming-conventions-and-style Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 scala testing and type safety
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/python-scala-translation/run1_scala-testing-and-type-safety Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 scala trait and class design
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/python-scala-translation/run1_scala-trait-and-class-design Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/schedule-planning/run3_calendar-slot-matching Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/schedule-planning/run3_extract-request-details Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/schedule-planning/run3_pdf-calendar-parsing Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Copy Input Data Directory Structure
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/stock-data-visualization/run3_Copy-Input-Data-Directory-Structure Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Define CSS Classes for Selection and Highlighting States
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/stock-data-visualization/run3_Define-CSS-Classes-for-Selection-and-Highlighting-States Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Identify ETF Entries for Conditional Rendering
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/stock-data-visualization/run3_Identify-ETF-Entries-for-Conditional-Rendering Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Implement Tooltip Display with Correct Positioning
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/stock-data-visualization/run3_Implement-Tooltip-Display-with-Correct-Positioning Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Load and Validate Stock Data for Ticker Field Presence
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/stock-data-visualization/run3_Load-and-Validate-Stock-Data-for-Ticker-Field-Presence Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Synchronize Bubble and Table Row Selection
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/stock-data-visualization/run3_Synchronize-Bubble-and-Table-Row-Selection Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/temperature-simulation/run3_glm-basics Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/temperature-simulation/run3_glm-parameter-modifier Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 diverse cuisine restaurant matching
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/travel-planning/run1_diverse-cuisine-restaurant-matching Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 multi city road trip planning
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/travel-planning/run1_multi-city-road-trip-planning Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 ohio attractions and pois research
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/travel-planning/run1_ohio-attractions-and-pois-research Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 pet friendly accommodation selection
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/travel-planning/run1_pet-friendly-accommodation-selection Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/travel-planning/run1_travel-budget-allocation Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Convert Frames to Grayscale and Count Objects
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/video-object-counting/run3_Convert-Frames-to-Grayscale-and-Count-Objects Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Extract Video Keyframes to PNG
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/video-object-counting/run3_Extract-Video-Keyframes-to-PNG Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Multi Condition Lookup with INDEX MATCH for Financial Data
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/weighted-gdp-calculation/run3_Multi-Condition-Lookup-with-INDEX-MATCH-for-Financial-Data Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Net Exports Percentage Calculation and Statistical Analysis
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/weighted-gdp-calculation/run3_Net-Exports-Percentage-Calculation-and-Statistical-Analysis Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 Weighted Mean Calculation with SUMPRODUCT
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/weighted-gdp-calculation/run3_Weighted-Mean-Calculation-with-SUMPRODUCT Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/anthropic-poster-design/run2_anthropic-brand-colors Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run2 anthropic brand typography
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/anthropic-poster-design/run2_anthropic-brand-typography Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run2 technical exploded view poster
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/anthropic-poster-design/run2_technical-exploded-view-poster Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run2 seven character regulated verse structure and rhyme
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/chinese-poem-generator/run2_seven-character-regulated-verse-structure-and-rhyme Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run2 seven character regulated verse tonal patterns
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/chinese-poem-generator/run2_seven-character-regulated-verse-tonal-patterns Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 california sc100 form fields
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/court-form-filling/run1_california-sc100-form-fields Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/court-form-filling/run1_python-pdf-form-filling Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 sc100 case data extraction
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/court-form-filling/run1_sc100-case-data-extraction Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/dbscan-parameter-tuning/run1_dbscan-custom-metric Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/dbscan-parameter-tuning/run1_greedy-centroid-matching Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 parallel grid search python
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/dbscan-parameter-tuning/run1_parallel-grid-search-python Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 pareto frontier extraction
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/dbscan-parameter-tuning/run1_pareto-frontier-extraction Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 grype trivy offline vulnerability scanning
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/dependency-vulnerability-check/run1_grype-trivy-offline-vulnerability-scanning Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/dependency-vulnerability-check/run1_npm-dependency-audit Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 package lock json parsing
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/dependency-vulnerability-check/run1_package-lock-json-parsing Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run1 vulnerability csv report generation
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/dependency-vulnerability-check/run1_vulnerability-csv-report-generation Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run2 earthquake time conversion
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/earthquake-plate-calculation/run2_earthquake-time-conversion Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run2 geospatial projection selection
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/earthquake-plate-calculation/run2_geospatial-projection-selection Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run2 pacific plate earthquake analysis
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/earthquake-plate-calculation/run2_pacific-plate-earthquake-analysis Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 enterprise data retrieval
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/enterprise-information-search/run3_enterprise-data-retrieval Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 sec 13f compare holdings q2 q3
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/financial-analysis/run3_sec-13f-compare-holdings-q2-q3 Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 sec 13f dataset structure
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/financial-analysis/run3_sec-13f-dataset-structure Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 sec 13f fund analysis aum stocks
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/financial-analysis/run3_sec-13f-fund-analysis-aum-stocks Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 sec 13f search fund coverpage
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/financial-analysis/run3_sec-13f-search-fund-coverpage Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 apache druid javascript rce patch creation
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/fix-security-bug/run3_apache-druid-javascript-rce-patch-creation Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 apache druid javascript rce vulnerability analysis
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/fix-security-bug/run3_apache-druid-javascript-rce-vulnerability-analysis Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 compile community pulse report json
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/github-repo-analytics/run3_compile-community-pulse-report-json Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 gh search issues exclude prs
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/github-repo-analytics/run3_gh-search-issues-exclude-prs Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/github-repo-analytics/run3_gh-search-prs-precise Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/nlp-paper-reproduction/run3_simpo-environment-setup Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 simpo loss implementation
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/nlp-paper-reproduction/run3_simpo-loss-implementation Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
Run3 simpo unit test execution
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/nlp-paper-reproduction/run3_simpo-unit-test-execution Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.
cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/offer-letter-generator/run2_docx-template-filling Skill
75★ repo[COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.