BIG-bench
Emerging4papers using it
2023first seen
'BIG-bench' is a benchmark designed to evaluate large language models in controlled settings, focusing on their performance across various tasks.
Papers using BIG-bench (4)
- Toolink: Linking Toolkit Creation And Using Through Chain-of-solving On Open-source ModelEvaluating Agentic AI In The Wild: Failure Modes, Drift Patterns, And A Production Evaluation FrameworkPrototype-Based Dynamic Steering for Large Language ModelsART: Automatic Multi-step Reasoning And Tool-use For Large Language Models