agentsclimarketplace

Engineering

99,663 rows, by stacks then stars

  • Run1 scala testing and type safety

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-haiku-4-5/python-scala-translation/run1_scala-testing-and-type-safety Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run1 sc100 case data extraction

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/court-form-filling/run1_sc100-case-data-extraction Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run1 grype trivy offline vulnerability scanning

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/dependency-vulnerability-check/run1_grype-trivy-offline-vulnerability-scanning Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run1 vulnerability csv report generation

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/dependency-vulnerability-check/run1_vulnerability-csv-report-generation Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 apache druid javascript rce vulnerability analysis

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/fix-security-bug/run3_apache-druid-javascript-rce-vulnerability-analysis Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 simpo environment setup

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/nlp-paper-reproduction/run3_simpo-environment-setup Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 simpo unit test execution

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/nlp-paper-reproduction/run3_simpo-unit-test-execution Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 read scala test spec

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/python-scala-translation/run3_read-scala-test-spec Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 database search ohio trip

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-opus-4-6/travel-planning/run3_database-search-ohio-trip Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run2 find trivy and cache

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-sonnet-4-6/dependency-vulnerability-check/run2_find-trivy-and-cache Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run2 run trivy audit

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-sonnet-4-6/dependency-vulnerability-check/run2_run-trivy-audit Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 check and setup python310

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-sonnet-4-6/nlp-paper-reproduction/run3_check-and-setup-python310 Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run2 glm lake mendota setup

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-claude-sonnet-4-6/temperature-simulation/run2_glm_lake_mendota_setup Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run1 csv security report generation

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3-flash-preview/dependency-vulnerability-check/run1_csv-security-report-generation Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run1 npm audit security analysis

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3-flash-preview/dependency-vulnerability-check/run1_npm-audit-security-analysis Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run1 vulnerability json parsing

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3-flash-preview/dependency-vulnerability-check/run1_vulnerability-json-parsing Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run1 token usage tracking

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3-flash-preview/enterprise-information-search/run1_token-usage-tracking Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 druid javascript vulnerability locator

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3-flash-preview/fix-security-bug/run3_druid-javascript-vulnerability-locator Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run2 run unit test and save results

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3-flash-preview/nlp-paper-reproduction/run2_run_unit_test_and_save_results Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run2 setup repo environment

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3-flash-preview/nlp-paper-reproduction/run2_setup_repo_environment Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 scala functional parsing and error handling

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3-flash-preview/python-scala-translation/run3_scala-functional-parsing-and-error-handling Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 glm config optimization

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3-flash-preview/temperature-simulation/run3_glm-config-optimization Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run1 pareto frontier optimization

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3.1-flash-lite-preview/dbscan-parameter-tuning/run1_pareto-frontier-optimization Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 dependency vulnerability scanner

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3.1-flash-lite-preview/dependency-vulnerability-check/run3_dependency_vulnerability_scanner Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 security report generation

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3.1-flash-lite-preview/dependency-vulnerability-check/run3_security_report_generation Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 cross fund security search

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3.1-flash-lite-preview/financial-analysis/run3_cross_fund_security_search Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run2 unit test execution and verification

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3.1-flash-lite-preview/nlp-paper-reproduction/run2_unit_test_execution_and_verification Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 environment setup and file generation

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3.1-flash-lite-preview/stock-data-visualization/run3_environment_setup_and_file_generation Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 calibrate glm

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3.1-flash-lite-preview/temperature-simulation/run3_calibrate_glm Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run3 update glm config

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3.1-flash-lite-preview/temperature-simulation/run3_update_glm_config Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run1 llm token tracking

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3.1-pro-preview/enterprise-information-search/run1_llm-token-tracking Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Run1 scala functional error handling

    cxcscmu/SkillLearnBench/skills/b3-teacher-feedback-gemini-3.1-pro-preview/python-scala-translation/run1_scala-functional-error-handling Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Npm vulnerability scanning

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-haiku-4-5/dependency-vulnerability-check/npm-vulnerability-scanning Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Security audit csv report

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-haiku-4-5/dependency-vulnerability-check/security-audit-csv-report Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Vulnerability data processing

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-haiku-4-5/dependency-vulnerability-check/vulnerability-data-processing Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Druid javascript injection fix

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-haiku-4-5/fix-security-bug/druid-javascript-injection-fix Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Maven druid build optimization

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-haiku-4-5/fix-security-bug/maven-druid-build-optimization Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Security patch workflow

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-haiku-4-5/fix-security-bug/security-patch-workflow Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Bug report identification

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-haiku-4-5/github-repo-analytics/bug-report-identification Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Environment setup pytorch

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-haiku-4-5/nlp-paper-reproduction/environment-setup-pytorch Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Pytorch testing logging

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-haiku-4-5/nlp-paper-reproduction/pytorch-testing-logging Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Glm config management

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-haiku-4-5/temperature-simulation/glm-config-management Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Travel database parser

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-haiku-4-5/travel-planning/travel-database-parser Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Pareto optimization

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-opus-4-6/dbscan-parameter-tuning/pareto-optimization Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Cvss score extraction

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-opus-4-6/dependency-vulnerability-check/cvss-score-extraction Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Trivy offline vulnerability scanning

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-opus-4-6/dependency-vulnerability-check/trivy-offline-vulnerability-scanning Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Vulnerability csv reporting

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-opus-4-6/dependency-vulnerability-check/vulnerability-csv-reporting Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Druid js vulnerability

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-opus-4-6/fix-security-bug/druid-js-vulnerability Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Jackson inject security

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-opus-4-6/fix-security-bug/jackson-inject-security Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Pytorch nlp setup

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-opus-4-6/nlp-paper-reproduction/pytorch-nlp-setup Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Meeting scheduler

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-opus-4-6/schedule-planning/meeting-scheduler Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Pareto optimization

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-sonnet-4-6/dbscan-parameter-tuning/pareto-optimization Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Cvss score extraction

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-sonnet-4-6/dependency-vulnerability-check/cvss-score-extraction Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Trivy offline vulnerability scanning

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-sonnet-4-6/dependency-vulnerability-check/trivy-offline-vulnerability-scanning Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Vulnerability csv reporting

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-sonnet-4-6/dependency-vulnerability-check/vulnerability-csv-reporting Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Jackson inject security

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-sonnet-4-6/fix-security-bug/jackson-inject-security Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Nlp preference optimization

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-claude-sonnet-4-6/nlp-paper-reproduction/nlp-preference-optimization Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Cvss score extraction

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-gemini-3-flash-preview/dependency-vulnerability-check/cvss-score-extraction Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Trivy offline vulnerability scanning

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-gemini-3-flash-preview/dependency-vulnerability-check/trivy-offline-vulnerability-scanning Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.

  • Vulnerability csv reporting

    cxcscmu/SkillLearnBench/skills/b4-skill-creator-gemini-3-flash-preview/dependency-vulnerability-check/vulnerability-csv-reporting Skill

    75 repo

    [COLM'26] SkillLearnBench is the first benchmark for evaluating continual learning methods that automatically generate agent skills.