Agent / Computer Use
81 篇论文指向 Agent 从单点任务转向长周期、可恢复、可评测的工作流。
- A Multi-Agent Platform for Automated Enterprise Analytics and Insight Generation 这篇论文需要先从标题和摘要判断它对应的任务场景、系统结构和产品迁移价值。
- How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks 这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。
- ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis 这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。
- Counter with Evidence! A Multi-Agent Memory Efficient Reasoning Framework for Hate Category Informed Counterspeech Generation 这篇主要讨论记忆、上下文或检索机制,重点是长期任务里的状态管理。