Key papers π₯ Trending (default) π Most cited π Newest first π€ A β Z by title 60 papers Β· trending (default) numbers = π₯ heat
ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU (2026) Fan Jiang et al.
17.73 AREX: Towards a Recursively Self-Improving Agent for Deep Research (2026) Shuqi Lu et al.
15.66 AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report (2026) AlayaWorld Team et al.
12.71 AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities (2026) Zichen Ding et al.
12.26 Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing (2026) Xinjie Zhang et al.
12.23 Subliminal Clocks: Latent Time Modelling in Diffusion Language Models (2026) Maximo Eduardo Rulli et al.
11.15 AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents (2026) Kunlun Zhu et al.
10.15 Video Generation Models are General-Purpose Vision Learners (2026) Letian Wang et al.
9.80 AutoIndex: Learning Representation Programs for Retrieval (2026) Sam O'Nuallain et al.
9.48 ISO: An RLVR-Native Optimization Stack (2026) Hanqing Zhu et al.
9.11 Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning (2026) Jian Hu et al.
9.11 FilmBench: A Film-Grade Benchmark for Cinematic Video Generation (2026) Shengyi Wang et al.
8.24 AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models (2026) Rintaro Otsubo et al.
7.98 Understanding Reasoning from Pretraining to Post-Training (2026) Jingyan Shen et al.
7.98 NexForge: Scaling Agent Capabilities through Requirement-Driven Task Synthesis for LLMs (2026) Jiarong Zhao et al.
7.96 Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation (2026) Guoxuan Chen et al.
7.85 EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration (2026) Jia-Kai Dong et al.
7.37 IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation (2026) Varun Gumma et al.
7.37 DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations (2026) Jiazhen Jiang et al.
6.95 A Controlled Study of Attention-Only Transformers (2026) Henry Ndubuaku et al.
5.96 Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Mode (2026) Nanbeige Lab et al.
5.88 Every Time I Hire a Linguist, Inference Costs Go Down: On Linguistic Rules as Effective Prompt Compressors (2026) Jianfei Ma et al.
5.88 RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail (2026) Amirreza Rouhi et al.
5.49 World Wide Models: Literary Tools for Cultural AI (2026) Nina Begus
5.49 Gemma 4 Technical Report (2026) Gemma Team et al.
5.49 Lost in Context: Addressing Context Anxiety in Large Language Models (2026) Ifueko Igbinedion et al.
5.49 NeuroCogMap Reveals Cognitive Organization of Large Language Models (2026) Zhongxiang Sun et al.
5.01 Where to Intervene? Benchmarking Fairness-Aware Learning on Differentially Private Synthetic Tabular Data (2026) Vin\'icius Gabriel Angelozzi et al.
5.01 LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4 (2026) Mobina Kashaniyan et al.
5.01 MILP-Evo: Closed-Loop Fully Automatic Design of MILP Solvers (2026) Jinbiao Nie et al.
5.01 Mitigating Matthew Effect: Multi-Hypergraph Boosted Multi-Interest Self-Supervised Learning for Conversational Recommendation (2026) Yongsen Zheng et al.
5.01 Decoupled Pipeline with Proposal Reranking and Score Fusion for Positive-Unlabeled Marine Species Detection (2026) Robert James Brock et al.
5.01 Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model (2026) Sibo Wang et al.
5.01 CoGoal3D: Collaborative 3D Object Detection with 3D-Aware Fusion and Refinement (2026) Zhihao Yang et al.
5.01 PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image (2026) Dankai Liao et al.
5.01 The Geometry of Personality: Activation Steering with Jungian Cognitive Functions (2026) Liu Zai (University of Glasgow) et al.
5.01 One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies (2026) Minh Ngoc Ta et al.
5.01 Control panels to clarify user intent with Large Language Models (2026) Ben Shneiderman
5.01 Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models (2026) Gwang Gook Lee et al.
5.01 Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization (2026) Bingjun Luo et al.
5.01 Do Modules Stay in Their Lane? Role Drift in Compound LLM Systems (2026) Xiaoyang Cao et al.
5.01 Ordered Action Tokens for Visuomotor Policy Learning (2026) Chaoqi Liu et al.
5.01 Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images (2026) Ronak Bhalgami
5.01 Prior laundering: learned priors with inherited, undetectable overconfidence (2026) Ali Siahkoohi et al.
5.01 Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders (2026) Pablo Santiago Potes Velasco et al.
5.01 From Seasonality to Semantics: Benchmarking a Hybrid Probabilistic Forecasting System for Roadblocks in Bolivia (2026) Rodrigo Vargas Sainz et al.
5.01 Data Quality over Capacity: Internalizing Documents into LoRA Adapters for Closed-Book QA (2026) Joan Figuerola Hurtado
5.01 Efficient Online LLM Watermark Detection via Rao-Blackwellized E-Processes (2026) Lu Luo et al.
5.01 Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning (2026) Hao Yang et al.
5.01 Small Vision-Language Models Know When They Are Wrong But Cannot Say So: A Two-Model Study of Stated versus Internal Confidence Under Realistic Image Degradation (2026) M M Asif Ferdous
5.01 Benchmarking Fine-tuning and Retrieval Strategies for a Multimodal Language Model on the NRC Reactor Operator Licensing Examination (2026) Isak Hwang et al.
5.01 FSE: Continual Learning for Named Entity Recognition by Fast-Slow Experts (2026) Yunan Zhang et al.
5.01 Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning (2026) Guanqun Zhao et al.
5.01 Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs (2026) Yuheng Zong et al.
5.01 Simplex Demixing: Disentangling Multiple Light-Flavor Jets at Colliders (2026) Gregorio de la Fuente et al.
5.01 Comparing Large Language Models on Scrum Certification-Style Questions: Accuracy, Stability, and Error Patterns (2026) Robson Alves Vilar et al.
4.39 AI Native Games: A Survey and Roadmap (2026) Zhiyue Xu et al.
4.39 Multi-Label Node Classification with Label Influence Propagation (2026) Yifei Sun et al.
4.39 Sequentially-Controlled Interactive Multi-Particle Flow-Maps for Online Feedback-Driven Search (2026) Binglin Ji et al.
4.39 AI for Cultural Heritage Textiles: Fine-Tuned Latent Diffusion for Novel Ulos Motif Synthesis (2026) Humasak Tommy Argo Simanjuntak et al.
4.39