agentsclimarketplace

Research profile

Skill DeyangLiu123/research-profile-skill/skills/research-profile

Inject an academic research profile and enforce scope boundaries for networking and systems optimization in distributed training and distributed inference (MLSys × computer networks). Use whenever the conversation involves research or academic work: reading, summarizing, or analyzing papers; literature search and recommendations; relevance judgments; surveys, related work, reviews, or rebuttals; research ideation and topic selection; venue selection; and academic self-introductions. Applies to Chinese requests such as 论文、文献、综述、相关工作、选题、研究方向、投稿、审稿、学术讨论. Keep work anchored to AI workloads on distributed infrastructure; prevent drift upward into pure model algorithms or accuracy research and downward into physical-layer devices, modulation, or coding.From its SKILL.md

Install
npx -y skills add DeyangLiu123/research-profile-skill --skill research-profile

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

2 things to look at

  • 27 days oldThe repository was created 27 days ago. New is not bad, but a brand new repository carrying a familiar-sounding name is the shape a typosquat arrives in, and there has been no time for anyone else to find a problem with it.
  • 1 stars1 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

SKILL.md

10.2 KB, ~3.4k tokens by cl100k_base, as published. Nobody here has run it

用户研究方向画像

核心职责:上下文注入与边界约束

将本画像作为当前用户所有学术任务的默认上下文。不要反复要求用户解释研究方向。本 skill 不是文献检索工具,也不是某个 MCP 的附属;它先约束 agent 如何定义问题、选择证据和判断相关性,再让 agent 按需调用任何资料源或工具。

对每个学术任务按以下顺序执行:

  1. 注入本画像的核心定位、术语、四条主线和分析视角。
  2. 在检索或分析前检查问题边界,排除由关键词造成的方向漂移。
  3. 按任务需要调用 OpenAlex MCP、PDF parser、Web、local vault 或其他资料源。
  4. 取得材料后再次做边界与相关性分级,再组织输出。

用户在当次任务中明确扩大、缩小或改变范围时,以当次指示为准。

核心定位

一句话:面向分布式训练与分布式推理的网络与系统优化,关注 AI workload 在多机、多集群、多地域或边云协同基础设施上的性能、资源效率、可靠性和生存性

需要正式表述时使用:

我的研究方向属于 machine learning systems + computer networks 的交叉方向。核心问题是:当训练和推理任务从单机扩展到多 GPU、多节点、多集群甚至多地域基础设施时,系统性能和服务质量会受到网络通信、资源竞争、拓扑差异、负载波动和故障事件的共同影响。因此,需要从网络机制、任务调度、请求路由、资源分配、仿真评估和生存性设计等角度,提高分布式训练与分布式推理的效率、稳定性和可靠性。

重点不是设计更好的模型,而是让训练和推理任务在真实分布式基础设施上跑得更高效、更稳定、更可靠,并能在故障和负载波动下维持服务能力。

四条研究主线

  1. 分布式训练的网络与系统优化:collective communication(All-Reduce / All-Gather / Reduce-Scatter)与网络拓扑的匹配;拓扑感知的通信调度、任务映射和资源分配;RDMA、拥塞控制、负载均衡对训练性能的影响;多任务并发训练的带宽分配、作业调度与公平性;straggler 缓解;训练任务在节点、链路或集群故障下的恢复。
  2. 分布式推理与大模型服务系统:请求路由、dynamic batching、admission control;模型切分与流水线/张量并行的推理调度;KV cache 的放置、迁移、复用和淘汰;多地域推理的延迟-带宽-成本-SLO 权衡;边云协同的任务卸载与模型部署;高并发下的负载均衡、尾延迟控制与服务降级;GPU、内存和网络带宽的联合资源分配。
  3. AI 系统的生存性、可靠性与故障恢复:GPU、服务器、链路、交换机、机架、集群或站点故障对训练与推理的影响;故障检测、任务迁移、重调度、重路由和 failover;故障下的副本选择、降级服务与 SLO 保障;checkpoint、恢复时间与资源重分配;冗余部署、弹性调度和资源利用率的权衡;恢复时间、可用性、任务完成率和 SLO 违约率等指标。
  4. 仿真器与评估方法:用 ASTRA-sim 评估大规模训练的计算、通信和拓扑影响;用 ns-3 / SAMAI/ns-3 研究网络协议、拓扑、拥塞和故障场景;构造训练/推理 workload、网络模型和故障模型;使用真实 trace、原型系统、小规模实验或公开基线评估仿真可信度。

边界判定

用三个锚点检查任务:AI workload × 分布式基础设施 × 系统变量。系统变量至少包括网络、通信、调度、资源分配、服务质量或故障恢复之一。缺少关键锚点时,不要因为出现了 AI、network、communication 等表面关键词就判为主线。

  • 向上跑偏:问题只优化模型结构、训练算法或精度指标,没有研究训练/推理在真实基础设施上的运行。
  • 向下跑偏:问题落到物理层器件、材料、天线、调制编码或链路电气特性,没有系统级 AI workload 与资源/调度问题。
  • 横向跑偏:问题是一般云计算、分布式系统或微服务机制,但没有结合分布式训练、推理或模型服务的 workload 特征。

先问:这项工作优化的是“模型本身”,还是“训练/推理任务在真实分布式基础设施上的运行”?如果是后者,再判断它映射到哪条主线。

给出结论时标注对应主线或触发的排除项:

  • 核心:直接落在四条主线内,包括 distributed training/inference systems、large model serving、AI cluster networking、collective communication、topology-aware scheduling、RDMA / congestion control for AI workloads、request routing / batching、KV cache management、resource allocation、tail-latency control、straggler mitigation、AI system resilience / fault tolerance、failure recovery 和 AI system/network simulation。
  • 沾边但非主线:有系统含义但缺少关键联系。说明缺在哪,以及机制是否可借鉴。典型例子包括未结合 AI workload 的一般云调度、未落到 AI workload 的传统分布式系统、未结合大模型特点的微服务可靠性,以及不讨论部署或网络影响的量化、蒸馏和模型压缩。
  • 不属于:纯模型结构或训练算法改进;只关注模型精度的 benchmark;纯物理层器件、调制编码或链路器件设计;经典联邦学习算法本身。

分任务默认行为

读论文 / 分析论文

不要只从模型精度视角总结。按论文类型选择以下维度,并以“对用户方向的启发”收束:

  • 研究对象与增量:训练、推理、模型服务、网络调度、生存性、仿真器或组合;相对已有工作的核心增量
  • 系统模型与 workload:GPU、服务器、交换机、集群、边缘节点、模型分片、缓存、副本、控制器;训练 collective、推理请求、模型并行策略和故障事件
  • 网络假设与瓶颈:带宽、时延、容量、拓扑、拥塞、多集群/多地域;通信开销、尾延迟、资源竞争、straggler、拓扑不匹配和恢复开销
  • 优化变量与目标:路由、速率、带宽切分、任务映射、模型放置、请求调度、batching、副本和 checkpoint;完成时间、延迟、吞吐、SLO、可用性、恢复时间和成本
  • 方法与可信度:MILP、启发式、近似算法、调度器、拥塞控制、仿真、trace-driven、testbed 或原型;基线、规模和统计方法是否合理
  • 工程可部署性:是否需要修改 NIC、交换机、训练框架、推理引擎、调度器或控制平面

不要把 abstract 或元数据当成全文证据。材料不足时明确区分论文陈述、合理推断和仍待核验的问题。

找论文 / 文献检索

  • 读取 references/literature-search.md 取得中英文 query 和 venue 优先级。
  • 若 host 提供名为 openalex 的 MCP 工具,读取 references/openalex-workflow.md 并按其中配方使用;OpenAlex 只提供资料,不定义研究边界。没有 OpenAlex MCP 时继续使用可用检索工具,不影响上下文注入和边界判定。
  • arXiv 只作补充;NeurIPS / ICLR / ICML 只优先其中的系统类论文。
  • 逐篇标注对应主线、相关性等级(核心 / 沾边 / 背景)和一句话理由。不要把引用数、搜索排名或 venue 单独当成质量结论。

写综述 / related work

优先按问题主线组织:分布式训练的通信与调度;分布式推理与模型服务;集群网络、拥塞控制与负载均衡;请求路由、dynamic batching 与 KV cache;多集群、多地域和边云 AI 服务;AI 系统的生存性与恢复;仿真、trace-driven evaluation 与故障注入;资源效率、SLO 和部署代价之间的权衡。

讨论选题 / idea

  • 先检查 idea 的边界和主线,再定义系统模型、workload、优化变量、目标函数、约束和 baseline。
  • 优先评估能否用 ASTRA-sim、ns-3 / SAMAI/ns-3、公开 trace、原型或小规模 testbed 验证。
  • 近期优先关注分布式推理系统、AI workload 网络仿真、AI 系统生存性、collective communication、拓扑感知调度和拥塞控制;将跨数据中心训练作为长期前沿跟踪,并关注它与推理服务、调度和可靠性设计的交叉。

自我介绍 / 方向陈述

  • 简短版:我做面向分布式训练与分布式推理的网络与系统优化,关注 AI 服务在分布式基础设施上的效率、可靠性和生存性。
  • 标准版:我做 machine learning systems 和 computer networks 的交叉研究,重点关注分布式训练/推理中的通信、调度、资源分配、故障恢复和仿真评估问题。
  • 学术版:我的方向属于 machine learning systems、distributed systems 和 computer networks 的交叉,关注 AI workload 在多节点、多集群或多地域基础设施上的性能优化、服务质量保障与生存性设计。

画像维护

  • 以本 SKILL.mdreferences/ 为可移植的唯一来源,不依赖本机绝对路径。
  • 用户要求“更新画像”时,修改受影响的核心定位、主线、边界和分任务行为;检索主题或 venue 变化时同步更新 references/literature-search.md
  • 中文交流时保留 collective communication、KV cache、SLO、straggler 等英文技术术语。
  • 将边界视为默认值而非硬约束。对不确定主题先给分级、理由和缺失证据,再询问是否调整范围。

What ships with it: 3 files

6.1 KB alongside SKILL.md

agents/

Keep looking

Skills are one crate of 326,645. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.