🌐 Preprint Link · 📄 PDF File · 🗺️ Taxonomy · 📚 Paper List · ✨ Contribute
Agent skills are emerging as a reusable procedural layer for LLM agents: they compress experience, encode domain know-how, package workflows, and help agents retrieve, compose, execute, refine, and govern capabilities across tasks. This repository accompanies the survey A Survey of Agent Skills: Toward Procedural Infrastructure for LLM Agents and collects papers around the agent-skill ecosystem.
@article{yang2026asurveyofagentskills,
doi = {10.20944/preprints202605.1276.v1},
url = {https://doi.org/10.20944/preprints202605.1276.v1},
year = 2026,
month = {May},
publisher = {Preprints},
author = {Cehao Yang and Xiaojun Wu and Honghao Liu and Xueyuan Lin and Chengjin Xu and Xuhui Jiang and Yuanliang Sun and Wenjie Zhang and Zhichao Shi and Yijie Xu and Jia Li and Hui Xiong and Jian Guo},
title = {A Survey of Agent Skills: Toward Procedural Infrastructure for LLM Agents},
journal = {Preprints}
}The survey organizes agent-skill research into six connected layers:
| Icon | Layer | What it Covers |
|---|---|---|
| 🧠 | Ontology | What a skill is, how it relates to memory, cognition, compression, and reusable procedural knowledge. |
| 📦 | Representation and Packaging | How skills are written, structured, serialized, distributed, and packaged. |
| 🔁 | Lifecycle | How skills are acquired, stored, retrieved, executed, refined, retired, and internalized. |
| ⚙️ | Runtime Integration | How skills connect to terminals, tools, multi-agent systems, benchmarks, and execution harnesses. |
| 🛡️ | Governance | How skill ecosystems handle marketplaces, security risks, safety, auditing, and trustworthy usage. |
| 🚀 | Application | Where agent skills are used in embodied robotics, games, web agents, GUI/mobile/OS agents, and coding workflows. |
Suggested row format:
| Paper Title | [arXiv](https://arxiv.org/abs/xxxx.xxxxx) | Author A, Author B, Author C | 2026 || Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| ReAct: Synergizing Reasoning and Acting in Language Models | https://arxiv.org/abs/2210.03629 | Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao | 2023 |
| Cognitive Architectures for Language Agents | https://arxiv.org/abs/2309.02427 | Theodore R. Sumers, Shunyu Yao, Karthik Narasimhan, Thomas L. Griffiths | 2024 |
| A Survey on the Memory Mechanism of Large Language Model based Agents | https://arxiv.org/abs/2404.13501 | Zeyu Zhang, Xiaohe Bo, Chen Ma, Rui Li, Xu Chen, Quanyu Dai, Jieming Zhu, Zhenhua Dong, Ji-Rong Wen | 2024 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| Experience Compression Spectrum: Unifying Memory, Skills, and Rules in LLM Agents | https://arxiv.org/abs/2604.15877 | Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He | 2026 |
| Procedural Knowledge Improves Agentic LLM Workflows | https://arxiv.org/abs/2511.07568 | Vincent Hsiao, Mark Roberts, Leslie Smith | 2025 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks | https://arxiv.org/abs/2602.12670 | Xiangyi Li, Wenbo Chen, Yimin Liu, Shenghan Zheng, Xiaokun Chen, Yifeng He, Yubo Li, Bingran You, Haotian Shen, Jiankai Sun, Shuyi Wang, Binxu Li, Qunhong Zeng, Di Wang, Xuandong Zhao, Yuanli Wang, Roey Ben Chaim, Zonglin Di, Yipeng Gao, Junwei He, Yizhuo He, Liqiang Jing, Luyang Kong, Xin Lan, Jiachen Li, Songlin Li, Yijiang Li, Yueqian Lin, Xinyi Liu, Xuanqing Liu, Haoran Lyu, Ze Ma, Bowei Wang, Runhui Wang, Tianyu Wang, Wengao Ye, Yue Zhang, Hanwen Xing, Yiqi Xue, Steven Dillmann, Han-chung Lee | 2026 |
| ExpeL: LLM Agents Are Experiential Learners | https://arxiv.org/abs/2308.10144 | Andrew Zhao, Daniel Huang, Quentin Xu, Matthieu Lin, Yong-Jin Liu, Gao Huang | 2024 |
| SOP-Agent: Empower General Purpose AI Agent with Domain-Specific SOPs | https://arxiv.org/abs/2501.09316 | Anbang Ye, Qianran Ma, Jia Chen, Muqi Li, Tong Li, Fujiao Liu, Siqi Mai, Meichen Lu, Haitao Bao, Yang You | 2025 |
| Agent Skills: A Data-Driven Analysis of Claude Skills for Extending Large Language Model Functionality | https://arxiv.org/abs/2602.08004 | George Ling, Shanshan Zhong, Richard Huang | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| ExpeL: LLM Agents Are Experiential Learners | https://arxiv.org/abs/2308.10144 | Andrew Zhao, Daniel Huang, Quentin Xu, Matthieu Lin, Yong-Jin Liu, Gao Huang | 2024 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| Voyager: An Open-Ended Embodied Agent with Large Language Models | https://arxiv.org/abs/2305.16291 | Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, Anima Anandkumar | 2023 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| SOP-Agent: Empower General Purpose AI Agent with Domain-Specific SOPs | https://arxiv.org/abs/2501.09316 | Anbang Ye, Qianran Ma, Jia Chen, Muqi Li, Tong Li, Fujiao Liu, Siqi Mai, Meichen Lu, Haitao Bao, Yang You | 2025 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| Skilldex: A Package Manager and Registry for Agent Skill Packages with Hierarchical Scope-Based Distribution | https://arxiv.org/abs/2604.16911 | Sampriti Saha, Pranav Hemanth | 2026 |
| From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills | https://arxiv.org/abs/2604.24026 | Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| Inducing Programmatic Skills for Agentic Tasks | https://arxiv.org/abs/2504.06821 | Zora Zhiruo Wang, Apurva Gandhi, Graham Neubig, Daniel Fried | 2025 |
| SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills | https://arxiv.org/abs/2504.07079 | Boyuan Zheng, Michael Y. Fatemi, Xiaolong Jin, Zora Zhiruo Wang, Apurva Gandhi, Yueqi Song, Yu Gu, Jayanth Srinivasa, Gaowen Liu, Graham Neubig, Yu Su | 2025 |
| Automated Skill Discovery for Language Agents through Exploration and Iterative Feedback | https://arxiv.org/abs/2506.04287 | Yongjin Yang, Sinjae Kang, Juyong Lee, Dongjun Lee, Se-Young Yun, Kimin Lee | 2025 |
| SkillCraft: Can LLM Agents Learn to Use Tools Skillfully? | https://arxiv.org/abs/2603.00718 | Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh | 2026 |
| SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning | https://arxiv.org/abs/2602.08234 | Peng Xia, Jianwen Chen, Hanyang Wang, Jiaqi Liu, Kaide Zeng, Yu Wang, Siwei Han, Yiyang Zhou, Xujiang Zhao, Haifeng Chen, Zeyu Zheng, Cihang Xie, Huaxiu Yao | 2026 |
| SkillX: Automatically Constructing Skill Knowledge Bases for Agents | https://arxiv.org/abs/2604.04804 | Chenxi Wang, Zhuoyun Yu, Xin Xie, Wuguannan Yao, Runnan Fang, Shuofei Qiao, Kexin Cao, Guozhou Zheng, Xiang Qi, Peng Zhang, Shumin Deng | 2026 |
| Dynamic Dual-Granularity Skill Bank for Agentic RL | https://arxiv.org/abs/2603.28716 | Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao | 2026 |
| XSkill: Continual Learning from Experience and Skills in Multimodal Agents | https://arxiv.org/abs/2603.12056 | Guanyu Jiang, Zhaochen Su, Xiaoye Qu, Yi R. Fung | 2026 |
| Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents | https://arxiv.org/abs/2602.01869 | Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, Haifeng Zhang, Jun Wang | 2026 |
| Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks | https://arxiv.org/abs/2604.20987 | Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha | 2026 |
| Skillact: Using skill abstractions improves llm agents | https://openreview.net/forum?id=6LG3cIRrF4 | Anthony Zhe Liu, Jongwook Choi, Sungryull Sohn, Yao Fu, Jaekyeom Kim, Dong-Ki Kim, Xinhe Wang, Jaewon Yoo, Honglak Lee | 2024 |
| PolySkill: Learning Generalizable Skills Through Polymorphic Abstraction | https://arxiv.org/abs/2510.15863 | Simon Yu, Gang Li, Weiyan Shi, Peng Qi | 2026 |
| CASCADE: Cumulative Agentic Skill Creation through Autonomous Development and Evolution | https://arxiv.org/abs/2512.23880 | Xu Huang, Junwu Chen, Yuxing Fei, Zhuohan Li, Philippe Schwaller, Gerbrand Ceder | 2026 |
| SKILLFOUNDRY: Building Self-Evolving Agent Skill Libraries from Heterogeneous Scientific Resources | https://arxiv.org/abs/2604.03964 | Shuaike Shen, Wenduo Cheng, Mingqian Ma, Alistair Turcan, Martin Jinye Zhang, Jian Ma | 2026 |
| Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills | https://arxiv.org/abs/2603.25158 | Jingwei Ni, Yihao Liu, Xinpeng Liu, Yutao Sun, Mengyu Zhou, Pengyu Cheng, Dexin Wang, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang | 2026 |
| ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning | https://arxiv.org/abs/2603.16060 | Yu Li, Rui Miao, Zhengling Qi, Tian Lan | 2026 |
| CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification | https://arxiv.org/abs/2604.01687 | Hanrong Zhang, Shicheng Fan, Henry Peng Zou, Yankai Chen, Zhenting Wang, Jiayu Zhou, Chengze Li, Wei-Chieh Huang, Yifei Yao, Kening Zheng, Xue Liu, Xiaoxiao Li, Philip S. Yu | 2026 |
| AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolution | https://arxiv.org/abs/2603.01145 | Yutao Yang, Junsong Li, Qianjun Pan, Bihao Zhan, Yuxuan Cai, Lin Du, Jie Zhou, Kai Chen, Qin Chen, Xin Li, Bo Zhang, Liang He | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| SkillX: Automatically Constructing Skill Knowledge Bases for Agents | https://arxiv.org/abs/2604.04804 | Chenxi Wang, Zhuoyun Yu, Xin Xie, Wuguannan Yao, Runnan Fang, Shuofei Qiao, Kexin Cao, Guozhou Zheng, Xiang Qi, Peng Zhang, Shumin Deng | 2026 |
| SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning | https://arxiv.org/abs/2602.08234 | Peng Xia, Jianwen Chen, Hanyang Wang, Jiaqi Liu, Kaide Zeng, Yu Wang, Siwei Han, Yiyang Zhou, Xujiang Zhao, Haifeng Chen, Zeyu Zheng, Cihang Xie, Huaxiu Yao | 2026 |
| Dynamic Dual-Granularity Skill Bank for Agentic RL | https://arxiv.org/abs/2603.28716 | Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao | 2026 |
| Arise: Agent reasoning with intrinsic skill evolution in hierarchical reinforcement learning | https://arxiv.org/abs/2603.16060 | Yu Li, Rui Miao, Zhengling Qi, Tian Lan | 2026 |
| Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scale | https://arxiv.org/abs/2603.02176 | Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu | 2026 |
| Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG | https://arxiv.org/abs/2604.14572 | Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh | 2026 |
| SKILLFOUNDRY: Building Self-Evolving Agent Skill Libraries from Heterogeneous Scientific Resources | https://arxiv.org/abs/2604.03964 | Shuaike Shen, Wenduo Cheng, Mingqian Ma, Alistair Turcan, Martin Jinye Zhang, Jian Ma | 2026 |
| Graph of Skills: Dependency-Aware Structural Retrieval for Massive Agent Skills | https://arxiv.org/abs/2604.05333 | Dawei Liu, Zongxia Li, Hongyang Du, Xiyang Wu, Shihang Gui, Yongbei Kuang, Lichao Sun | 2026 |
| SkillNet: Create, Evaluate, and Connect AI Skills | https://arxiv.org/abs/2603.04448 | Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| Skill Retrieval Augmentation for Agentic AI | https://arxiv.org/abs/2604.24594 | Weihang Su, Jianming Long, Qingyao Ai, Yichen Tang, Changyue Wang, Yiteng Tu, Yiqun Liu | 2026 |
| How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings | https://arxiv.org/abs/2604.04323 | Yujian Liu, Jiabao Ji, Li An, Tommi Jaakkola, Yang Zhang, Shiyu Chang | 2026 |
| CUA-Skill: Develop Skills for Computer Using Agent | https://arxiv.org/abs/2601.21123 | Tianyi Chen, Yinheng Li, Michael Solodko, Sen Wang, Nan Jiang, Tingyuan Cui, Junheng Hao, Jongwoo Ko, Sara Abdali, Leon Xu, Suzhen Zheng, Hao Fan, Pashmina Cameron, Justin Wagle, Kazuhito Koishida | 2026 |
| AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolution | https://arxiv.org/abs/2603.01145 | Yutao Yang, Junsong Li, Qianjun Pan, Bihao Zhan, Yuxuan Cai, Lin Du, Jie Zhou, Kai Chen, Qin Chen, Xin Li, Bo Zhang, Liang He | 2026 |
| SkillRouter: Skill Routing for LLM Agents at Scale | https://arxiv.org/abs/2603.22455 | YanZhao Zheng, ZhenTao Zhang, Chao Ma, YuanQiang Yu, JiHuai Zhu, Yong Wu, Tianze Xu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu | 2026 |
| SkillReducer: Optimizing LLM Agent Skills for Token Efficiency | https://arxiv.org/abs/2603.29919 | Yudong Gao, Zongjie Li, Yuanyuanyuan, Zimo Ji, Pingchuan Ma, Shuai Wang | 2026 |
| Graph of Skills: Dependency-Aware Structural Retrieval for Massive Agent Skills | https://arxiv.org/abs/2604.05333 | Dawei Liu, Zongxia Li, Hongyang Du, Xiyang Wu, Shihang Gui, Yongbei Kuang, Lichao Sun | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| PolySkill: Learning Generalizable Skills Through Polymorphic Abstraction | https://arxiv.org/abs/2510.15863 | Simon Yu, Gang Li, Weiyan Shi, Peng Qi | 2026 |
| SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills | https://arxiv.org/abs/2504.07079 | Boyuan Zheng, Michael Y. Fatemi, Xiaolong Jin, Zora Zhiruo Wang, Apurva Gandhi, Yueqi Song, Yu Gu, Jayanth Srinivasa, Gaowen Liu, Graham Neubig, Yu Su | 2025 |
| Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scale | https://arxiv.org/abs/2603.02176 | Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu | 2026 |
| GraSP: Graph-Structured Skill Compositions for LLM Agents | https://arxiv.org/abs/2604.17870 | Tianle Xia, Lingxiang Hu, Yiding Sun, Ming Xu, Lan Xu, Siying Wang, Wei Xu, Jie Jiang | 2026 |
| SkillCraft: Can LLM Agents Learn to Use Tools Skillfully? | https://arxiv.org/abs/2603.00718 | Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh | 2026 |
| SkillOrchestra: Learning to Route Agents via Skill Transfer | https://arxiv.org/abs/2602.19672 | Jiayu Wang, Yifei Ming, Zixuan Ke, Shafiq Joty, Aws Albarghouthi, Frederic Sala | 2026 |
| Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesis | https://arxiv.org/abs/2602.03279 | Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Xuan Ren, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| SkillTracer: Structural Failure Attribution and Refinement of Agentic Skills in Long-Horizon Web Tasks | https://openreview.net/forum?id=OiyEjThGeZ | Yuyang Li, Yiran Dou, Jie-Jing Shao, Yueming Lyu, Ivor Tsang, Haiyan Yin | |
| Meta Context Engineering via Agentic Skill Evolution | https://arxiv.org/abs/2601.21557 | Haoran Ye, Xuning He, Vincent Arak, Haonan Dong, Guojie Song | 2026 |
| Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents | https://arxiv.org/abs/2602.01869 | Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, Haifeng Zhang, Jun Wang | 2026 |
| MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents | https://arxiv.org/abs/2602.02474 | Haozhen Zhang, Quanyu Long, Jianzhu Bao, Tao Feng, Weizhi Zhang, Haodong Yue, Wenya Wang | 2026 |
| EvoSkill: Automated Skill Discovery for Multi-Agent Systems | https://arxiv.org/abs/2603.02766 | Salaheddin Alzubi, Noah Provenzano, Jaydon Bingham, Weiyuan Chen, Tu Vu | 2026 |
| Memento-Skills: Let Agents Design Agents | https://arxiv.org/abs/2603.18743 | Huichi Zhou, Siyuan Guo, Anjie Liu, Zhongwei Yu, Ziqin Gong, Bowen Zhao, Zhixun Chen, Menglong Zhang, Yihang Chen, Jinsong Li, Runyu Yang, Qiangbin Liu, Xinlei Yu, Jianmin Zhou, Na Wang, Chunyang Sun, Jun Wang | 2026 |
| Dynamic Dual-Granularity Skill Bank for Agentic RL | https://arxiv.org/abs/2603.28716 | Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao | 2026 |
| CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification | https://arxiv.org/abs/2604.01687 | Hanrong Zhang, Shicheng Fan, Henry Peng Zou, Yankai Chen, Zhenting Wang, Jiayu Zhou, Chengze Li, Wei-Chieh Huang, Yifei Yao, Kening Zheng, Xue Liu, Xiaoxiao Li, Philip S. Yu | 2026 |
| SkillClaw: Let Skills Evolve Collectively with Agentic Evolver | https://arxiv.org/abs/2604.08377 | Ziyu Ma, Shidong Yang, Yuxiang Ji, Xucong Wang, Yong Wang, Yiming Hu, Tongwen Huang, Xiangxiang Chu | 2026 |
| SkillForge: Forging Domain-Specific, Self-Evolving Agent Skills in Cloud Technical Support | https://arxiv.org/abs/2604.08618 | Xingyan Liu, Xiyue Luo, Linyu Li, Ganghong Huang, Jianfeng Liu, Honglin Qiao | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents | https://arxiv.org/abs/2602.01869 | Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, Haifeng Zhang, Jun Wang | 2026 |
| Dynamic Dual-Granularity Skill Bank for Agentic RL | https://arxiv.org/abs/2603.28716 | Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao | 2026 |
| Reinforcement learning for self-improving agent with skill library | https://arxiv.org/abs/2512.17102 | Jiongxiao Wang, Qiaojing Yan, Yawei Wang, Yijun Tian, Soumya Smruti Mishra, Zhichao Xu, Megha Gandhi, Panpan Xu, Lin Lee Cheong | 2025 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle | https://arxiv.org/abs/2510.16079 | Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi | 2025 |
| SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization | https://arxiv.org/abs/2604.02268 | Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Chengcheng Han, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen | 2026 |
| Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents | https://arxiv.org/abs/2604.10674 | Hao Wang, Guozhi Wang, Han Xiao, Yufeng Zhou, Yue Pan, Jichao Wang, Ke Xu, Yafei Wen, Xiaohu Ruan, Xiaoxin Chen, Honggang Qi | 2026 |
| StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason | https://arxiv.org/abs/2507.02841 | Kaiyi Zhang, Ang Lv, Jinpeng Li, Yongbo Wang, Feng Wang, Haoyuan Hu, Rui Yan | 2025 |
| Internalizing Meta-Experience into Memory for Guided Reinforcement Learning in Large Language Models | https://arxiv.org/abs/2602.10224 | Shiting Huang, Zecheng Li, Yu Zeng, Qingnan Ren, Zhen Fang, Qisheng Su, Kou Shi, Lin Chen, Zehui Chen, Feng Zhao | 2026 |
| Dynamic Dual-Granularity Skill Bank for Agentic RL | https://arxiv.org/abs/2603.28716 | Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces | https://arxiv.org/abs/2601.11868 | Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini, Boxuan Li, Harsh Raj, Ivan Bercovich, Lin Shi, Jeong Yeon Shin, Thomas Walshe, E. Kelly Buchanan, Junhong Shen, Guanghao Ye, Haowei Lin, Jason Poulos, Maoyu Wang, Marianna Nezhurina, Jenia Jitsev, Di Lu, Orfeas Menis Mastromichalakis, Zhiwei Xu, Zizhao Chen, Yue Liu, Robert Zhang, Leon Liangyu Chen, Anurag Kashyap, Jan-Lucas Uslu, Jeffrey Li, Jianbo Wu, Minghao Yan, Song Bian, Vedang Sharma, Ke Sun, Steven Dillmann, Akshay Anand, Andrew Lanpouthakoun, Bardia Koopah, Changran Hu, Etash Guha, Gabriel H. S. Dreiman, Jiacheng Zhu, Karl Krauth, Li Zhong, Niklas Muennighoff, Robert Amanfu, Shangyin Tan, Shreyas Pimpalgaonkar, Tushar Aggarwal, Xiangning Lin, Xin Lan, Xuandong Zhao, Yiqing Liang, Yuanli Wang, Zilong Wang, Changzhi Zhou, David Heineman, Hange Liu, Harsh Trivedi, John Yang, Junhong Lin, Manish Shetty, Michael Yang, Nabil Omi, Negin Raoof, Shanda Li, Terry Yue Zhuo, Wuwei Lin, Yiwei Dai, Yuxin Wang, Wenhao Chai, Shang Zhou, Dariush Wahdany, Ziyu She, Jiaming Hu, Zhikang Dong, Yuxuan Zhu, Sasha Cui, Ahson Saiyed, Arinbjörn Kolbeinsson, Jesse Hu, Christopher Michael Rytting, Ryan Marten, Yixin Wang, Alex Dimakis, Andy Konwinski, Ludwig Schmidt | 2026 |
| Terminal Agents Suffice for Enterprise Automation | https://arxiv.org/abs/2604.00073 | Patrice Bechard, Orlando Marquez Ayala, Emily Chen, Jordan Skelton, Sagar Davasam, Srinivas Sunkara, Vikas Yadav, Sai Rajeswar | 2026 |
| Toward Scalable Terminal Task Synthesis via Skill Graphs | https://arxiv.org/abs/2604.25727 | Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, Jiangtao Guan, Yun Yang, Dingxin Hu, Jiang Zhou, Xing Wu, Zhuo Han, Feng Zhang, Lilin Wang | 2026 |
| AgentClick: A Skill-Based Human-in-the-Loop Review Layer for Terminal AI Agents | https://arxiv.org/abs/2604.16520 | Haomin Zhuang, Hanwen Xing, Xiangliang Zhang | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| Toolformer: Language Models Can Teach Themselves to Use Tools | https://arxiv.org/abs/2302.04761 | Timo Schick, Jane Dwivedi-Yu, Roberto Dessì, Roberta Raileanu, Maria Lomeli, Luke Zettlemoyer, Nicola Cancedda, Thomas Scialom | 2023 |
| MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools | https://arxiv.org/abs/2509.09734 | Zikang Guo, Benfeng Xu, Chiwei Zhu, Wentao Hong, Xiaorui Wang, Zhendong Mao | 2025 |
| Agent Skill Framework: Perspectives on the Potential of Small Language Models in Industrial Environments | https://arxiv.org/abs/2602.16653 | Yangjie Xu, Lujun Li, Lama Sleem, Niccolo Gentile, Yewei Song, Yiqun Wang, Siming Ji, Wenbo Wu, Radu State | 2026 |
| Procedural Knowledge Improves Agentic LLM Workflows | https://arxiv.org/abs/2511.07568 | Vincent Hsiao, Mark Roberts, Leslie Smith | 2025 |
| SkillCraft: Can LLM Agents Learn to Use Tools Skillfully? | https://arxiv.org/abs/2603.00718 | Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework | https://arxiv.org/abs/2308.00352 | Sirui Hong, Mingchen Zhuge, Jiaqi Chen, Xiawu Zheng, Yuheng Cheng, Ceyao Zhang, Jinlin Wang, Zili Wang, Steven Ka Shing Yau, Zijuan Lin, Liyang Zhou, Chenyu Ran, Lingfeng Xiao, Chenglin Wu, Jürgen Schmidhuber | 2024 |
| When Single-Agent with Skills Replace Multi-Agent Systems and When They Fail | https://arxiv.org/abs/2601.04748 | Xiaoxiao Li | 2026 |
| ABSTRAL: Automatic Design of Multi-Agent Systems Through Iterative Refinement and Topology Optimization | https://arxiv.org/abs/2603.22791 | Weijia Song, Jiashu Yue, Zhe Pang | 2026 |
| SkillGraph: Self-Evolving Multi-Agent Collaboration with Multimodal Graph Topology | https://arxiv.org/abs/2604.17503 | Zheng Nie, Ruolin Shen, Xinlei Yu, Bo Yin, Jiangning Zhang, Xiaobin Hu | 2026 |
| Memento-Skills: Let Agents Design Agents | https://arxiv.org/abs/2603.18743 | Huichi Zhou, Siyuan Guo, Anjie Liu, Zhongwei Yu, Ziqin Gong, Bowen Zhao, Zhixun Chen, Menglong Zhang, Yihang Chen, Jinsong Li, Runyu Yang, Qiangbin Liu, Xinlei Yu, Jianmin Zhou, Na Wang, Chunyang Sun, Jun Wang | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| ClawArena: Benchmarking AI Agents in Evolving Information Environments | https://arxiv.org/abs/2604.04202 | Haonian Ji, Kaiwen Xiong, Siwei Han, Peng Xia, Shi Qiu, Yiyang Zhou, Jiaqi Liu, Jinlong Li, Bingzhou Li, Zeyu Zheng, Cihang Xie, Huaxiu Yao | 2026 |
| SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks | https://arxiv.org/abs/2602.12670 | Xiangyi Li, Wenbo Chen, Yimin Liu, Shenghan Zheng, Xiaokun Chen, Yifeng He, Yubo Li, Bingran You, Haotian Shen, Jiankai Sun, Shuyi Wang, Binxu Li, Qunhong Zeng, Di Wang, Xuandong Zhao, Yuanli Wang, Roey Ben Chaim, Zonglin Di, Yipeng Gao, Junwei He, Yizhuo He, Liqiang Jing, Luyang Kong, Xin Lan, Jiachen Li, Songlin Li, Yijiang Li, Yueqian Lin, Xinyi Liu, Xuanqing Liu, Haoran Lyu, Ze Ma, Bowei Wang, Runhui Wang, Tianyu Wang, Wengao Ye, Yue Zhang, Hanwen Xing, Yiqi Xue, Steven Dillmann, Han-chung Lee | 2026 |
| SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks | https://arxiv.org/abs/2604.20087 | Shanshan Zhong, Yi Lu, Jingjie Ning, Yibing Wan, Lihan Feng, Yuyi Ao, Leonardo F. R. Ribeiro, Markus Dreyer, Sean Ammirati, Chenyan Xiong | 2026 |
| Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scale | https://arxiv.org/abs/2603.02176 | Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu | 2026 |
| AgentFactory: A Self-Evolving Framework Through Executable Subagent Accumulation and Reuse | https://arxiv.org/abs/2603.18000 | Zhang Zhang, Shuqi Lu, Hongjin Qian, Di He, Zheng Liu | 2026 |
| SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents | https://arxiv.org/abs/2604.17308 | Ziao Zhang, Kou Shi, Shiting Huang, Avery Nie, Yu Zeng, Yiming Zhao, Zhen Fang, Qishen Su, Haibo Qiu, Wei Yang, Qingnan Ren, Shun Zou, Wenxuan Huang, Lin Chen, Zehui Chen, Feng Zhao | 2026 |
| AgentEvolver: Towards Efficient Self-Evolving Agent System | https://arxiv.org/abs/2511.10395 | Yunpeng Zhai, Shuchang Tao, Cheng Chen, Anni Zou, Ziqian Chen, Qingxu Fu, Shinji Mai, Li Yu, Jiaji Deng, Zouying Cao, Zhaoyang Liu, Bolin Ding, Jingren Zhou | 2025 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| Agent Skills: A Data-Driven Analysis of Claude Skills for Extending Large Language Model Functionality | https://arxiv.org/abs/2602.08004 | George Ling, Shanshan Zhong, Richard Huang | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| When Skills Lie: Hidden-Comment Injection in LLM Agents | https://arxiv.org/abs/2602.10498 | Qianli Wang, Boyang Ma, Minghui Xu, Yue Zhang | 2026 |
| Agent Skills Enable a New Class of Realistic and Trivially Simple Prompt Injections | https://arxiv.org/abs/2510.26328 | David Schmotz, Sahar Abdelnabi, Maksym Andriushchenko | 2025 |
| SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement | https://arxiv.org/abs/2602.14211 | Xiaojun Jia, Jie Liao, Simeng Qin, Jindong Gu, Wenqi Ren, Xiaochun Cao, Yang Liu, Philip Torr | 2026 |
| Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks | https://arxiv.org/abs/2602.20156 | David Schmotz, Luca Beurer-Kellner, Sahar Abdelnabi, Maksym Andriushchenko | 2026 |
| Prompt Injection Attacks on Agentic Coding Assistants: A Systematic Analysis of Vulnerabilities in Skills, Tools, and Protocol Ecosystems | https://arxiv.org/abs/2601.17548 | Narek Maloyan, Dmitry Namiot | 2026 |
| BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning | https://arxiv.org/abs/2604.09378 | Guiyao Tie, Jiawen Shi, Pan Zhou, Lichao Sun | 2026 |
| SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems | https://arxiv.org/abs/2604.06811 | Yunhao Feng, Yifan Ding, Yingshui Tan, Boren Zheng, Yanming Guo, Xiaolong Li, Kun Zhai, Yishan Li, Wenke Huang | 2026 |
| HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents? | https://arxiv.org/abs/2604.15415 | Yukun Jiang, Yage Zhang, Michael Backes, Xinyue Shen, Yang Zhang | 2026 |
| Malicious Agent Skills in the Wild: A Large-Scale Security Empirical Study | https://arxiv.org/abs/2602.06547 | Yi Liu, Zhihao Chen, Yanjun Zhang, Gelei Deng, Yuekang Li, Jianting Ning, Ying Zhang, Leo Yu Zhang | 2026 |
| Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale | https://arxiv.org/abs/2601.10338 | Yi Liu, Weizhe Wang, Ruitao Feng, Yao Zhang, Guangquan Xu, Gelei Deng, Yuekang Li, Leo Zhang | 2026 |
| Red Skills or Blue Skills? A Dive Into Skills Published on ClawHub | https://arxiv.org/abs/2604.13064 | Haichuan Hu, Ye Shang, Quanjun Zhang | 2026 |
| RouteGuard: Internal-Signal Detection of Skill Poisoning in LLM Agents | https://arxiv.org/abs/2604.22888 | Wenjie Xiao, Xuehai Tang, Biyu Zhou, Songlin Hu, Jizhong Han | 2026 |
| SkillClone: Multi-Modal Clone Detection and Clone Propagation Analysis in the Agent Skill Ecosystem | https://arxiv.org/abs/2603.22447 | Jiaying Zhu, Lyuye Zhang, Wenbo Guo, Yang Liu | 2026 |
| Formal analysis and supply chain security for agentic AI skills | https://arxiv.org/abs/2603.00195 | Varun Pratap Bhardwaj | 2026 |
| Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems | https://arxiv.org/abs/2604.03081 | Yubin Qu, Yi Liu, Tongcheng Geng, Gelei Deng, Yuekang Li, Leo Yu Zhang, Ying Zhang, Lei Ma | 2026 |
| SkillProbe: Security Auditing for Emerging Agent Skill Marketplaces via Multi-Agent Collaboration | https://arxiv.org/abs/2603.21019 | Zihan Guo, Zhiyu Chen, Xiaohang Nie, Jianghao Lin, Yuanjian Zhou, Weinan Zhang | 2026 |
| SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills | https://arxiv.org/abs/2604.06550 | Yinghan Hou, Zongyou Yang | 2026 |
| Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills | https://arxiv.org/abs/2604.25109 | Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu | 2026 |
| SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement | https://arxiv.org/abs/2604.04989 | Zenghao Duan, Yuxin Tian, Zhiyi Yin, Liang Pang, Jingcheng Deng, Zihao Wei, Shicheng Xu, Yuyao Ge, Xueqi Cheng | 2026 |
| Malicious Or Not: Adding Repository Context to Agent Skill Classification | https://arxiv.org/abs/2603.16572 | Florian Holzbauer, David Schmidt, Gabriel Gegenhuber, Sebastian Schrittwieser, Johanna Ullrich | 2026 |
| Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats | https://arxiv.org/abs/2603.11619 | Xinhao Deng, Yixiang Zhang, Jiaqing Wu, Jiaqi Bai, Sibo Yi, Zhuoheng Zou, Yue Xiao, Rennai Qiu, Jianan Ma, Jialuo Chen, Xiaohu Du, Xiaofang Yang, Shiwen Cui, Changhua Meng, Weiqiang Wang, Jiaxing Song, Ke Xu, Qi Li | 2026 |
| STARS: Skill-Triggered Audit for Request-Conditioned Invocation Safety in Agent Systems | https://arxiv.org/abs/2604.10286 | Guijia Zhang, Shu Yang, Xilin Gong, Di Wang | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| SoK: Agentic Skills--Beyond Tool Use in LLM Agents | https://arxiv.org/abs/2602.20867 | Yanna Jiang, Delong Li, Haiyu Deng, Baihe Ma, Xu Wang, Qin Wang, Guangsheng Yu | 2026 |
| Credential Leakage in LLM Agent Skills: A Large-Scale Empirical Study | https://arxiv.org/abs/2604.03070 | Zhihao Chen, Ying Zhang, Yi Liu, Gelei Deng, Yuekang Li, Yanjun Zhang, Jianting Ning, Leo Yu Zhang, Lei Ma, Zhiqiang Li | 2026 |
| NeMo Guardrails: A Toolkit for Controllable and Safe LLM Applications with Programmable Rails | https://arxiv.org/abs/2310.10501 | Traian Rebedea, Razvan Dinu, Makesh Sreedhar, Christopher Parisien, Jonathan Cohen | 2023 |
| Agent Contracts: A Formal Framework for Resource-Bounded Autonomous AI Systems | https://arxiv.org/abs/2601.08815 | Qing Ye, Jing Tan | 2026 |
| SkillNet: Create, Evaluate, and Connect AI Skills | https://arxiv.org/abs/2603.04448 | Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen | 2026 |
| Towards Secure Agent Skills: Architecture, Threat Taxonomy, and Security Analysis | https://arxiv.org/abs/2604.02837 | Zhiyuan Li, Jingzheng Wu, Xiang Ling, Xing Cui, Tianyue Luo | 2026 |
| SafeClaw-R: Towards Safe and Secure Multi-Agent Personal Assistants | https://arxiv.org/abs/2603.28807 | Haoyu Wang, Zibo Xiao, Yedi Zhang, Christopher M. Poskitt, Jun Sun | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| Do As I Can, Not As I Say: Grounding Language in Robotic Affordances | https://arxiv.org/abs/2204.01691 | Michael Ahn, Anthony Brohan, Noah Brown, Yevgen Chebotar, Omar Cortes, Byron David, Chelsea Finn, Chuyuan Fu, Keerthana Gopalakrishnan, Karol Hausman, Alex Herzog, Daniel Ho, Jasmine Hsu, Julian Ibarz, Brian Ichter, Alex Irpan, Eric Jang, Rosario Jauregui Ruano, Kyle Jeffrey, Sally Jesmonth, Nikhil J Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Kuang-Huei Lee, Sergey Levine, Yao Lu, Linda Luu, Carolina Parada, Peter Pastor, Jornell Quiambao, Kanishka Rao, Jarek Rettinghouse, Diego Reyes, Pierre Sermanet, Nicolas Sievers, Clayton Tan, Alexander Toshev, Vincent Vanhoucke, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Mengyuan Yan, Andy Zeng | 2022 |
| XSkill: Cross Embodiment Skill Discovery | https://arxiv.org/abs/2307.09955 | Mengda Xu, Zhenjia Xu, Cheng Chi, Manuela Veloso, Shuran Song | 2023 |
| Uni-Skill: Building Self-Evolving Skill Repository for Generalizable Robotic Manipulation | https://arxiv.org/abs/2603.02623 | Senwei Xie, Yuntian Zhang, Ruiping Wang, Xilin Chen | 2026 |
| Agentic Skill Discovery | https://arxiv.org/abs/2405.15019 | Xufeng Zhao, Cornelius Weber, Stefan Wermter | 2024 |
| Lifelong Robot Library Learning: Bootstrapping Composable and Generalizable Skills for Embodied Control with Language Models | https://arxiv.org/abs/2406.18746 | Georgios Tziafas, Hamidreza Kasaei | 2024 |
| VLM Agents Generate Their Own Memories: Distilling Experience into Embodied Programs of Thought | https://arxiv.org/abs/2406.14596 | Gabriel Sarch, Lawrence Jang, Michael J. Tarr, William W. Cohen, Kenneth Marino, Katerina Fragkiadaki | 2025 |
| ASCENT: Autonomous Skill Learning Toward Complex Embodied Tasks With Foundation Models | https://doi.org/10.1109/ICRA55743.2025.11127927 | Haolin Wu, Yuecheng Liu, Junyi Dong, Heng Zhang, Sitong Mao, Hesheng Wang, Weigang Wu, Shunbo Zhou | 2025 |
| Real-Time Verification of Embodied Reasoning for Generative Skill Acquisition | https://arxiv.org/abs/2505.11175 | Bo Yue, Shuqi Guo, Kaiyu Hu, Chujiao Wang, Benyou Wang, Kui Jia, Guiliang Liu | 2025 |
| SELF-VLA: A Skill Enhanced Agentic Vision-Language-Action Framework for Contact-Rich Disassembly | https://arxiv.org/abs/2603.11080 | Chang Liu, Sibo Tian, Xiao Liang, Minghui Zheng | 2026 |
| Learning Without Losing Identity: Capability Evolution for Embodied Agents | https://arxiv.org/abs/2604.07799 | Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| A deep hierarchical approach to lifelong learning in minecraft | https://doi.org/10.1609/aaai.v31i1.10744 | Chen Tessler, Shahar Givony, Tom Zahavy, Daniel Mankowitz, Shie Mannor | 2017 |
| Hierarchical and interpretable skill acquisition in multi-task reinforcement learning | https://arxiv.org/abs/1712.07294 | Tianmin Shu, Caiming Xiong, Richard Socher | 2017 |
| Skill reinforcement learning and planning for open-world long-horizon tasks | https://arxiv.org/abs/2303.16563 | Haoqi Yuan, Chi Zhang, Hongcheng Wang, Feiyang Xie, Penglin Cai, Hao Dong, Zongqing Lu | 2023 |
| MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledge | https://arxiv.org/abs/2206.08853 | Linxi Fan, Guanzhi Wang, Yunfan Jiang, Ajay Mandlekar, Yuncong Yang, Haoyi Zhu, Andrew Tang, De-An Huang, Yuke Zhu, Anima Anandkumar | 2022 |
| MCU: An evaluation framework for open-ended game agents | https://proceedings.mlr.press/v267/zheng25j.html | Xinyue Zheng, Haowei Lin, Kaichen He, Zihao Wang, Qiang Fu, Haobo Fu, Zilong Zheng, Yitao Liang | 2025 |
| Voyager: An Open-Ended Embodied Agent with Large Language Models | https://arxiv.org/abs/2305.16291 | Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, Anima Anandkumar | 2023 |
| Odyssey: Empowering minecraft agents with open-world skills | https://arxiv.org/abs/2407.15325 | Shunyu Liu, Yaoru Li, Kongcheng Zhang, Zhenyu Cui, Wenkai Fang, Yuxuan Zheng, Tongya Zheng, Mingli Song | 2024 |
| See and Think: Embodied Agent in Virtual Environment | https://arxiv.org/abs/2311.15209 | Zhonghan Zhao, Wenhao Chai, Xuan Wang, Li Boyi, Shengyu Hao, Shidong Cao, Tian Ye, Gaoang Wang | 2024 |
| Rethinking Agent Design: From Top-Down Workflows to Bottom-Up Skill Evolution | https://arxiv.org/abs/2505.17673 | Jiawei Du, Jinlong Wu, Yuzheng Chen, Yucheng Hu, Bing Li, Joey Tianyi Zhou | 2025 |
| SAG-Agent: Enabling Long-Horizon Reasoning in Strategy Games via Dynamic Knowledge Graphs | https://arxiv.org/abs/2510.15259 | Chenwei Tang, Lin Long, Xinyu Liu, Jingyu Xing, Zizhou Wang, Joey Tianyi Zhou, Jiawei Du, Liangli Zhen, Jiancheng Lv | 2026 |
| SCALAR: Learning and Composing Skills through LLM Guided Symbolic Planning and Deep RL Grounding | https://arxiv.org/abs/2603.09036 | Renos Zabounidis, Yue Wu, Simon Stepputtis, Woojun Kim, Yuanzhi Li, Tom Mitchell, Katia Sycara | 2026 |
| Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks | https://arxiv.org/abs/2604.20987 | Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| Mind2Web: Towards a Generalist Agent for the Web | https://arxiv.org/abs/2306.06070 | Xiang Deng, Yu Gu, Boyuan Zheng, Shijie Chen, Samuel Stevens, Boshi Wang, Huan Sun, Yu Su | 2023 |
| WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models | https://arxiv.org/abs/2401.13919 | Hongliang He, Wenlin Yao, Kaixin Ma, Wenhao Yu, Yong Dai, Hongming Zhang, Zhenzhong Lan, Dong Yu | 2024 |
| WebArena: A Realistic Web Environment for Building Autonomous Agents | https://arxiv.org/abs/2307.13854 | Shuyan Zhou, Frank F. Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, Graham Neubig | 2024 |
| Agent Workflow Memory | https://arxiv.org/abs/2409.07429 | Zora Zhiruo Wang, Jiayuan Mao, Daniel Fried, Graham Neubig | 2024 |
| Inducing Programmatic Skills for Agentic Tasks | https://arxiv.org/abs/2504.06821 | Zora Zhiruo Wang, Apurva Gandhi, Graham Neubig, Daniel Fried | 2025 |
| SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills | https://arxiv.org/abs/2504.07079 | Boyuan Zheng, Michael Y. Fatemi, Xiaolong Jin, Zora Zhiruo Wang, Apurva Gandhi, Yueqi Song, Yu Gu, Jayanth Srinivasa, Gaowen Liu, Graham Neubig, Yu Su | 2025 |
| SkillEvo: An Experience Learning Framework with Reinforcement Learning for Skill Evolution | https://openreview.net/forum?id=S1cIE9pe3k | Zishan Xu, Yifu Guo, Yuquan Lu, Fengyu Yang, Zhiyuan Yao, Jiaye Lin, Ruyi Gong, Lihua Cai | 2026 |
| WebXSkill: Skill Learning for Autonomous Web Agents | https://arxiv.org/abs/2604.13318 | Zhaoyang Wang, Qianhui Wu, Xuchao Zhang, Chaoyun Zhang, Wenlin Yao, Fazle Elahi Faisal, Baolin Peng, Si Qin, Suman Nath, Qingwei Lin, Chetan Bansal, Dongmei Zhang, Saravan Rajmohan, Jianfeng Gao, Huaxiu Yao | 2026 |
| ContractSkill: Repairable Contract-Based Skills for Multimodal Web Agents | https://arxiv.org/abs/2603.20340 | Zijian Lu, Yiping Zuo, Yupeng Nie, Xin He, Weibei Fan, Lianyong Qi, Shi Jin | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| OS-Copilot: Towards Generalist Computer Agents with Self-Improvement | https://arxiv.org/abs/2402.07456 | Zhiyong Wu, Chengcheng Han, Zichen Ding, Zhenmin Weng, Zhoumianze Liu, Shunyu Yao, Tao Yu, Lingpeng Kong | 2024 |
| AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents | https://arxiv.org/abs/2405.14573 | Christopher Rawles, Sarah Clinckemaillie, Yifan Chang, Jonathan Waltz, Gabrielle Lau, Marybeth Fair, Alice Li, William Bishop, Wei Li, Folawiyo Campbell-Ajala, Daniel Toyama, Robert Berry, Divya Tyamagundlu, Timothy Lillicrap, Oriana Riva | 2025 |
| Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale | https://arxiv.org/abs/2409.08264 | Rogerio Bonatti, Dan Zhao, Francesco Bonacci, Dillon Dupont, Sara Abdali, Yinheng Li, Yadong Lu, Justin Wagle, Kazuhito Koishida, Arthur Bucker, Lawrence Jang, Zack Hui | 2024 |
| Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skills | https://arxiv.org/abs/2506.10387 | Yuquan Xie, Zaijing Li, Rui Shao, Gongwei Chen, Kaiwen Zhou, Yinchuan Li, Dongmei Jiang, Liqiang Nie | 2025 |
| CUA-Skill: Develop Skills for Computer Using Agent | https://arxiv.org/abs/2601.21123 | Tianyi Chen, Yinheng Li, Michael Solodko, Sen Wang, Nan Jiang, Tingyuan Cui, Junheng Hao, Jongwoo Ko, Sara Abdali, Leon Xu, Suzhen Zheng, Hao Fan, Pashmina Cameron, Justin Wagle, Kazuhito Koishida | 2026 |
| OSExpert: Computer-Use Agents Learning Professional Skills via Exploration | https://arxiv.org/abs/2603.07978 | Jiateng Liu, Zhenhailong Wang, Rushi Wang, Bingxuan Li, Jeonghwan Kim, Aditi Tiwari, Pengfei Yu, Denghui Zhang, Heng Ji | 2026 |
| SkillDroid: Compile Once, Reuse Forever | https://arxiv.org/abs/2604.14872 | Qijia Chen, Andrea Bellucci, Zhida Sun, Giulio Jacucci | 2026 |
| Paper Title | Paper URL | Author List | Year |
|---|---|---|---|
| SWE-bench: Can Language Models Resolve Real-World GitHub Issues? | https://arxiv.org/abs/2310.06770 | Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik Narasimhan | 2024 |
| Swe-exp: Experience-driven software issue resolution | https://arxiv.org/abs/2507.23361 | Silin Chen, Shaoxin Lin, Yuling Shi, Heng Lian, Xiaodong Gu, Longfei Yun, Dong Chen, Lin Cao, Jiyang Liu, Nu Xia, others | 2025 |
| Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents | https://arxiv.org/abs/2509.23045 | Zonghan Yang, Shengjie Wang, Kelin Fu, Wenyang He, Weimin Xiong, Yibo Liu, Yibo Miao, Bofei Gao, Yejie Wang, Yingwei Ma, Yanhao Li, Yue Liu, Zhenxing Hu, Kaitai Zhang, Shuyi Wang, Huarong Chen, Flood Sung, Yang Liu, Yang Gao, Zhilin Yang, Tianyu Liu | 2025 |
| Hybrid-Gym: Training Coding Agents to Generalize Across Tasks | https://arxiv.org/abs/2602.16819 | Yiqing Xie, Emmy Liu, Gaokai Zhang, Nachiket Kotalwar, Shubham Gandhi, Sathwik Acharya, Xingyao Wang, Carolyn Rose, Graham Neubig, Daniel Fried | 2026 |
| SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering? | https://arxiv.org/abs/2603.15401 | Tingxu Han, Yi Zhang, Wei Song, Chunrong Fang, Zhenyu Chen, Youcheng Sun, Lijie Hu | 2026 |
| EffiSkill: Agent Skill Based Automated Code Efficiency Optimization | https://arxiv.org/abs/2603.27850 | Zimu Wang, Yuling Shi, Mengfan Li, Zijun Liu, Jie M. Zhang, Chengcheng Wan, Xiaodong Gu | 2026 |
| Scaling Coding Agents via Atomic Skills | https://arxiv.org/abs/2604.05013 | Yingwei Ma, Yue Liu, Xinlong Yang, Yanhao Li, Kelin Fu, Yibo Miao, Yuchong Xie, Zhexu Wang, Shing-Chi Cheung | 2026 |
| SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering | https://arxiv.org/abs/2604.09297 | Jingzhi Gong, Ruizhen Gu, Zhiwei Fei, Yazhuo Cao, Lukas Twist, Alina Geiger, Shuo Han, Dominik Sobania, Federica Sarro, Jie M. Zhang | 2026 |
