Awesome Large Language Models
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
correctness
loadingβ¦
π€
Ask AI
Awesome correctness β curated papers, datasets & benchmarks Β· Awesome Large Language Models
β all topics
overview
correctness
15 papers tagged correctness β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
15 papers Β· trending (default)
numbers = π₯ heat
Preserving Privacy, Increasing Accessibility, and Reducing Cost: An On-Device Artificial Intelligence Model for Medical Transcription and Note Generation
(2025)
Johnson Thomas et al.
2.87
Unified Thinker: A General Reasoning Modular Core for Image Generation
(2026)
Sashuai Zhou et al.
1.94
CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning
(2026)
Eric Onyame et al.
1.94
TAROT: Test-driven and Capability-adaptive Curriculum Reinforcement Fine-tuning for Code Generation with Large Language Models
(2026)
Chansung Park et al.
1.94
Beyond Length Scaling: Synergizing Breadth and Depth for Generative Reward Models
(2026)
Qiyuan Zhang et al.
1.94
AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation
(2026)
Zhaohe Liao et al.
1.94
Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs
(2026)
Wanli Yang et al.
1.94
AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents
(2026)
Sharareh Younesian et al.
1.94
Optimizing Retrieval-Augmented Generation: Analysis of Hyperparameter Impact on Performance and Efficiency
(2025)
Adel Ammar et al.
1.28
STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs
(2025)
Zongzhao Li et al.
1.28
ExGRPO: Learning to Reason from Experience
(2025)
Runzhe Zhan et al.
1.28
From Charts to Code: A Hierarchical Benchmark for Multimodal Models
(2025)
Jiahao Tang et al.
1.28
From Code Foundation Models to Agents and Applications: A Practical Guide to Code Intelligence
(2025)
Jian Yang et al.
1.28
Self-Improving VLM Judges Without Human Annotations
(2025)
Inna Wanyin Lin et al.
1.28
CLINIC: Evaluating Multilingual Trustworthiness in Language Models for Healthcare
(2025)
Akash Ghosh et al.
1.28