CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization Paper • 2607.25659 • Published 6 days ago • 80
HumanCLAW: Can Vision-Language Models Act Through a Body? Paper • 2607.27180 • Published 5 days ago • 71
DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space Paper • 2607.25675 • Published 6 days ago • 61
TACO: Tool-Augmented Credit Optimization for Agentic Tool Use Paper • 2606.30251 • Published Jun 29 • 22
TACO: Tool-Augmented Credit Optimization for Agentic Tool Use Paper • 2606.30251 • Published Jun 29 • 22
Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation Paper • 2606.09131 • Published Jun 8 • 3
Exploring Knowledge Purification in Multi-Teacher Knowledge Distillation for LLMs Paper • 2602.01064 • Published Feb 1 • 2
OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions Paper • 2602.05843 • Published Feb 5 • 61
Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning Paper • 2601.20209 • Published Jan 28 • 24
Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction Paper • 2512.00395 • Published Nov 29, 2025 • 2
Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction Paper • 2512.00395 • Published Nov 29, 2025 • 2