行业资讯
📅 2026/7/25 2:32:13
AA-Omniscience: Evaluating Cross-Domain Knowledge Reliability in Large Language Models
一、文章主要内容总结本文针对现有大语言模型(LLM)评估多侧重通用能力、忽视跨领域事实准确性与知识校准的问题,提出了AA-Omniscience基准,用于衡量模型的事实召回能力和知识校准水平。基准设计核心:涵盖6个经济相关领域(商业、人文社科、健康、法律、软件工程、科学工程与数学)、42个细分主题,共6000道问题,源自权威学术和行业来源。采用全知指数(Omniscience Index)作为核心指标(范围-100至100),奖励正确答案、惩罚幻觉输出、鼓励不确定时弃权,0分代表正确与错误答案数量持平。辅助指标包括准确率、幻觉率(尝试回答但错误的比例)和运行成本,全面评估模型实用性。关键研究发现:仅3个前沿模型的全知指数得分高于0,Claude 4.1 Opus以4.8分位列第一,多数模型存在事实准确性和知识校准缺陷。模型性能具有显著领域差异性:Claude 4.1 Opus在法律、软件工程等领域领先,GPT-5.1擅长商业领域,Grok 4在健康和科学工程领域表现最佳。模型整体智能与事实可靠性无强相关性,大模型规模与幻觉率无必然联系,部分小模型(如NVIDIA Nemotron Nano 9B V2)展现出更优的知识校准能力。现有评估奖励“猜测”而非“弃权”的机制,是导致模型幻