【CNMO科技消息】8月11日消息,韩国SKT自主研发的AI模型A.X K2在国际数学奥林匹克竞赛(IMO)评测中取得29分的成绩,与2026年IMO金牌分数线持平,成为除美国和中国之外地区开发的AI模型中唯一达到该标准的选手。与此同时,该模型在全球数学推理基准测试中也创下并列最高分纪录,其数学推理能力获得多方验证。
![]()
图源网络
据SKT新闻室公布的信息,A.X K2在IMO 2026的六道题目评测中获得29分,满分42分。这一分数恰好与今年IMO金牌分数线相同。值得注意的是,中国小红书旗下的dots-note-3.0在该评测中取得满分42分,A.X K2则是紧随其后、唯一达到金牌标准的韩国本土AI模型。
在IMO 2025往届试题评测中,A.X K2同样表现出色,取得35分的成绩,超过了当时的金牌分数线。在韩国数学奥林匹克(KMO)2026第二轮评测中,该模型更是斩获满分。此前,其前代模型A.X K1在KMO第一轮考试中也曾获得韩国自研模型中的最高分。
在开源AI平台Hugging Face的MathArena AIME 2026排行榜上,A.X K2以97.1%的准确率登顶。AIME是美国数学奥林匹克的选拔考试,MathArena AIME 2026基于今年AIME试题公开了30道题目,用于评估AI模型的最终答案准确率。在这一高难度数学推理评测中,A.X K2与OpenAI前首席技术官米拉·穆拉蒂创立的Thinking Machines Lab旗下的Inkling模型并列最高分。中国阶跃星辰的Step-3.5-Flash取得96.67%,月之暗面的Kimi-K2.6获得96.4%。
![]()
图源网络
数学能力之所以被视为AI模型的核心性能指标,原因在于它能够检验模型将复杂问题拆解为多个步骤、进行逻辑推理并得出一致结论的能力,而非单纯的计算速度。数学问题的另一优势在于答案对错分明,便于客观验证模型的推理能力,这与自然语言评测中难以区分"看似合理"和"真正正确"答案的情况形成对比。
正因如此,高水平的数学推理能力不仅是金融、会计等领域的重要应用基础,也成为衡量AI在制造工艺优化、物流调度、科学研究等需要复杂计算和多阶段判断的产业领域应用潜力的关键指标。计算或推理过程中的微小误差可能导致成本上升或决策失误,因此AI模型的精确推理能力至关重要。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.