Qwen-3-8B-base
Emerging5papers using it
2025first seen
The 'Qwen-3-8B-Base' is a benchmark dataset used to evaluate the performance and reasoning capabilities of large language model agents in the context of self-evolution and tool integration.
Papers using Qwen-3-8B-base (5)
- Clip Your Sequences Fairly: Enforcing Length Fairness for Sequence-Level RLfg-expo: Frontier-guided exploration-prioritized policy optimization via adaptive kl and gaussian curriculumAgent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated ReasoningOBLR-PO: A Theoretical Framework for Stable Reinforcement LearningAsymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning