AREX: Towards a Recursively Self-Improving Agent for Deep Research Paper • 2607.21461 • Published 5 days ago • 141
AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents Paper • 2607.18754 • Published 7 days ago • 24
UCFE: A User-Centric Financial Expertise Benchmark for Large Language Models Paper • 2410.14059 • Published Oct 17, 2024 • 63