
OpenAI 推出 IndQA 基准测试,评估 AI 在印度 12 种语言和 10 个文化领域的理解与推理能力,覆盖 2,278 道由专家设计的问题,旨在超越传统多语言基准的局限。
在人工智能(AI)快速发展的今天,OpenAI 始终致力于让通用人工智能(AGI)惠及全人类。然而,一个关键挑战在于:如何确保 AI 系统不仅能理解英语,还能深刻融入不同语言和文化的语境?据统计,全球约 80% 的人口不以英语为母语,但现有的非英语能力基准测试却存在明显短板。
例如,MMMLU 等主流多语言基准测试已趋于饱和——顶尖模型得分接近天花板,难以区分真实进步。更关键的是,这些测试多聚焦于翻译或选择题,无法真正衡量 AI 对语境、文化、历史以及当地居民生活关切的理解能力。这恰恰是评估 AI 语言能力的核心所在。
为此,OpenAI 正式推出 IndQA——一个专为评估 AI 模型在印度语言和文化领域理解与推理能力而设计的新基准。印度拥有约 10 亿非英语母语人口、22 种官方语言(其中至少 7 种语言的使用者超过 5000 万),并且是 ChatGPT 的第二大市场。IndQA 的发布,是 OpenAI 持续改进印度用户体验、推动技术更广泛普及的重要一步。
IndQA 的独特之处在于,它专注于评估 AI 对印度文化及日常生活的知识与推理能力,而非简单的语言翻译。该基准包含 2,278 道问题,覆盖 12 种语言和 10 个文化领域,由 261 位来自印度各地的领域专家共同创建。
值得一提的是,考虑到印度日常对话中常见的代码切换现象,IndQA 特别加入了印地英语(Hinglish)问题。
每个数据点包含:
IndQA 采用基于评分标准的方法。模型对每道题的回应会根据专家设定的标准逐项打分,每项标准都有权重分值。最终得分为满足标准的得分之和。模型评分由自动化的模型评分器完成,确保一致性。
IndQA 的创建经历了多轮严格流程:
专家撰写问题:OpenAI 与印度各地的合作伙伴合作,招募了 10 个领域的专家。他们根据自身地域和专业背景,撰写了具有挑战性、注重推理的提示。所有专家均为相关语言(及英语)的母语使用者,并具备深厚的领域知识。
对抗性过滤:每道题都先由当时最强大的 OpenAI 模型(包括 GPT-4o、OpenAI o3、GPT-4.5 以及部分 GPT-5)进行测试。只有多数模型无法给出可接受答案的问题才被保留,从而确保基准的难度和区分度。
详细评分标准:专家为每道题提供评分标准,类似于论文考试的评分细则。这些标准用于评估候选模型的回答质量。
理想答案与审核:专家提供理想答案及英文翻译,随后经过同行评审和迭代修改,直至最终定稿。
语言:孟加拉语
领域:文学与语言学
提示:“‘দণ্ডক থেকে মরিচঝাঁপি’ উপন্যাসের লেখক নিম্নবর্ণের পুরুষ ও নারীদের দণ্ডকারন্যে পুনর্বাসন পরবর্তী জীবন কিভাবে দেখিয়েছেন? দণ্ডকারণ্যে পুনর্বাসন কি সরকারী উদাসীনতার ফল? পরিবর্তিত প্রাকৃতিক পরিবেশের সাথে উদ্বাস্তুরা কিভাবে মানিয়ে নিয়েছিল?”
英文翻译:孟加拉语小说《Dandak Theke Marichjhanpi》的作者如何描绘低种姓男性和女性在丹达卡兰亚安置后的生活?丹达卡兰亚的安置是否是政府冷漠的结果?难民如何适应新的自然景观?
语言:孟加拉语
领域:美食与烹饪
提示:“কোন পরিপ্রেক্ষিতে উনিশ শতকের শেষ দিক থেকে রান্নার বইগুলো বেরচ্ছিল ? প্রথম বাংলা রান্নার বইটির সাথে বিপ্রদাস মুখোপাধ্যায় রচিত বইটির পার্থক্য কোথায় ? বিপ্রদাসের উদ্যোগে প্রকাশিত পত্রিকাটি চলেছিল কতদিন ? বিপ্রদাস ও প্রজ্ঞা সুন্দরীর লেখা অনুসরণ করে দিঘাপতিয়া থেকে কোন বইটি বেরিয়েছিল?”
英文翻译:19世纪末以来,烹饪书籍是在什么背景下出版的?第一本孟加拉语烹饪书与Bipradas Mukherjee所著的书有何不同?Bipradas创办的杂志发行了多久?继Bipradas和Pragya Sundari的著作之后,Dighapatiya出版了哪本书?
通过 IndQA,OpenAI 能够评估前沿模型在印度语言上的表现,并追踪过去几年的进步。结果显示,OpenAI 的模型在印度语言能力上已取得显著提升(存在一定局限),但仍有巨大的改进空间。
OpenAI 还按语言和领域对 IndQA 表现进行了分层分析,并将 GPT-5 Thinking High 与其他前沿模型进行了比较。
由于不同语言的问题并不完全相同,IndQA 并非语言排行榜。跨语言得分不应被视为语言能力的直接比较。该基准的核心价值在于衡量 AI 在特定文化语境下的理解与推理能力,而非单纯的语言翻译或选择题表现。
IndQA 的推出只是第一步。OpenAI 计划为其他语言和地区创建类似的基准测试,以推动 AI 真正实现全球化。对于印度用户而言,这意味着更智能、更贴合本地文化的产品体验。
随着 AI 模型在 IndQA 上的持续改进,我们有理由期待:未来的 AI 不仅能回答你的问题,还能理解你来自哪里、关心什么。这不仅是技术的进步,更是实现 AGI 普惠人类使命的关键一步。
本文由 OpenAI 官方博客内容改编,旨在提供关于 IndQA 基准测试的深度解读与 SEO 优化版本。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。