AI 基准排行榜

主流大语言模型在 MMLU、HumanEval、GSM8K、MATH、BBH、GPQA 等标准基准上的成绩对比

* MMLU:多任务语言理解 | HumanEval:代码生成 | GSM8K/MATH:数学推理 | BBH:复杂推理 | GPQA:研究生级问答。数据截至 2026 年 7 月,仅供参考。

查看 AI 模型参数价格对比 →

请作者喝杯咖啡

如果这些工具对你有帮助,欢迎赞赏支持~
您的鼓励是我持续更新的最大动力

自愿赠与 | 用于服务器维护 | 不支持退款 | 18岁以上
微信赞赏二维码