← all papers · overview

Arabicnumbench: Evaluating Arabic Number Reading In Large Language Models

Abstract

We present ArabicNumBench, a comprehensive benchmark for evaluating large language models on Arabic number reading tasks across Eastern Arabic-Indic numerals (0-9 in Arabic script) and Western Arabic numerals (0-9). We evaluate 71 models from 10 providers using four prompting strategies (zero-shot, zero-shot CoT, few-shot, few-shot CoT) on 210 number reading tasks spanning six contextual categorie

Related papers

Ranked by semantic similarity — how closely each paper's abstract matches this one (100% = near-identical topic).