AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large L... 文章主要内容与创新点总结一、主要内容本文针对阿拉伯语大型语言模型(LLMs)评估缺乏聚焦核心语言能力的现状,提出了AraLingBench——一个完全由人工标注的基准测试集,用于评估阿拉伯语LLMs的基础语言能力。1. 背景与现有不足阿拉伯语NLP领域虽涌现大量专用或双语LLMs,但现有评估基准(如ArabicMMLU、BALSAM等)侧重事实回忆、专业知识或任务导向性能,忽视了语法、形态学等核心语言能力的直接测试。而阿拉伯语具有复杂形态、丰富屈折变化和灵活句法等独特挑战,核心语言能力是真实语言理解的基础,现有基准无法有效诊断模型的真实语言掌握程度。2. AraLingBench构建核心维度:涵盖语法、形态学、拼写(正字法)、阅读理解、句法5个核心语言类别,共150道多项选择题(每类30题),由阿拉伯语语言学专家设计并审核。构建流程:经过问题生成、难度与多样性筛选、专家质量控制、难度标注四个严格阶段,确保题目有效性、无歧义性和难度梯度(简单33.3%、中等49.3%、困难17.3%)。格式特点:83.3%为四选项题型,16.7%为三选项题型,正确答案位置分布均匀,无系统性偏差。3. 实验评估与关键发现对3