BFCL
Emerging18papers using it
2026first seen
The BFCL dataset/benchmark contains instances of tool-selection failures in LLM agents and is used to evaluate the attention mechanisms and decision-making processes of these models in selecting the correct tools.
Papers using BFCL (18)
- Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation ModelsWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationReason Less, Verify More: Deterministic Gates Recover a Silent Policy-Violation Failure Mode in Tool-Using LLM AgentsSkill or Skip? Learning Selective Skill Invocation in Agentic Tasks via Dual-Granularity Preference LearningScaling Agentic Capabilities via Grounded Interaction SynthesisPACT: Privileged Trace Co-Training for Multi-Turn Tool-Use AgentsLooking Is Not Picking: An Attention-Segment Account of Tool-Selection Failures in LLM AgentsTwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM RoutingNotation Matters: A Benchmark Study of Token-Optimized Formats in Agentic AI SystemsHow Many Tools Should an LLM Agent See? A Chance-Corrected AnswerCapability-Aligned Hierarchical Learning for Tool-Augmented LLMsBoosting Tool-Calling Capabilities of Large Language Models via a Novel In-Context Learning ApproachTSCG: Deterministic Tool-Schema Compilation for Agentic LLM DeploymentsCoEvolve: Training LLM Agents via Agent-Data Mutual EvolutionBreaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic ModelsTry, Check and Retry: A Divide-and-Conquer Framework for Boosting Long-context Tool-Calling Performance of LLMsBeyond Max Tokens: Stealthy Resource Amplification via Tool Calling Chains in LLM AgentsLinguistic and Argument Diversity in Synthetic Data for Function-Calling Agents