-
Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
Paper • 2605.27922 • Published -
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
Paper • 2605.10912 • Published • 46 -
UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
Paper • 2607.08768 • Published • 34 -
Auditing Agent Harness Safety
Paper • 2605.14271 • Published • 55
Collections
Discover the best community collections!
Collections including paper arxiv:2605.26086
-
MemForest: An Efficient Agent Memory System with Hierarchical Temporal Indexing
Paper • 2605.23986 • Published • 17 -
Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital World
Paper • 2605.26086 • Published • 25 -
From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills
Paper • 2605.23899 • Published • 29
-
Agent Learning via Early Experience
Paper • 2510.08558 • Published • 276 -
Learning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon Tasks
Paper • 2510.08002 • Published • 24 -
Self-Improving LLM Agents at Test-Time
Paper • 2510.07841 • Published • 10 -
The Denario project: Deep knowledge AI agents for scientific discovery
Paper • 2510.26887 • Published • 8
-
Large Language Models Orchestrating Structured Reasoning Achieve Kaggle Grandmaster Level
Paper • 2411.03562 • Published • 70 -
Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning
Paper • 2502.06060 • Published • 37 -
MLGym: A New Framework and Benchmark for Advancing AI Research Agents
Paper • 2502.14499 • Published • 196 -
SurveyX: Academic Survey Automation via Large Language Models
Paper • 2502.14776 • Published • 100
-
Auditing Agent Harness Safety
Paper • 2605.14271 • Published • 55 -
NeuroClaw Technical Report
Paper • 2604.24696 • Published • 1 -
Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
Paper • 2605.13831 • Published • 90 -
TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
Paper • 2607.05804 • Published • 20
-
Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
Paper • 2603.19220 • Published • 70 -
Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
Paper • 2605.20164 • Published • 6 -
GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
Paper • 2605.19577 • Published • 59 -
EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL
Paper • 2605.18703 • Published • 51
-
ComfyUI-R1: Exploring Reasoning Models for Workflow Generation
Paper • 2506.09790 • Published • 53 -
Saffron-1: Towards an Inference Scaling Paradigm for LLM Safety Assurance
Paper • 2506.06444 • Published • 73 -
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
Paper • 2506.11763 • Published • 74 -
Agentic Reasoning: Reasoning LLMs with Tools for the Deep Research
Paper • 2502.04644 • Published • 4
-
Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
Paper • 2605.27922 • Published -
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
Paper • 2605.10912 • Published • 46 -
UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
Paper • 2607.08768 • Published • 34 -
Auditing Agent Harness Safety
Paper • 2605.14271 • Published • 55
-
Auditing Agent Harness Safety
Paper • 2605.14271 • Published • 55 -
NeuroClaw Technical Report
Paper • 2604.24696 • Published • 1 -
Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
Paper • 2605.13831 • Published • 90 -
TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
Paper • 2607.05804 • Published • 20
-
MemForest: An Efficient Agent Memory System with Hierarchical Temporal Indexing
Paper • 2605.23986 • Published • 17 -
Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital World
Paper • 2605.26086 • Published • 25 -
From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills
Paper • 2605.23899 • Published • 29
-
Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
Paper • 2603.19220 • Published • 70 -
Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
Paper • 2605.20164 • Published • 6 -
GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
Paper • 2605.19577 • Published • 59 -
EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL
Paper • 2605.18703 • Published • 51
-
Agent Learning via Early Experience
Paper • 2510.08558 • Published • 276 -
Learning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon Tasks
Paper • 2510.08002 • Published • 24 -
Self-Improving LLM Agents at Test-Time
Paper • 2510.07841 • Published • 10 -
The Denario project: Deep knowledge AI agents for scientific discovery
Paper • 2510.26887 • Published • 8
-
ComfyUI-R1: Exploring Reasoning Models for Workflow Generation
Paper • 2506.09790 • Published • 53 -
Saffron-1: Towards an Inference Scaling Paradigm for LLM Safety Assurance
Paper • 2506.06444 • Published • 73 -
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
Paper • 2506.11763 • Published • 74 -
Agentic Reasoning: Reasoning LLMs with Tools for the Deep Research
Paper • 2502.04644 • Published • 4
-
Large Language Models Orchestrating Structured Reasoning Achieve Kaggle Grandmaster Level
Paper • 2411.03562 • Published • 70 -
Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning
Paper • 2502.06060 • Published • 37 -
MLGym: A New Framework and Benchmark for Advancing AI Research Agents
Paper • 2502.14499 • Published • 196 -
SurveyX: Academic Survey Automation via Large Language Models
Paper • 2502.14776 • Published • 100