目录
趣味测试
格式转换
生成器
开发工具
手册
AI 基准排行榜
主流大语言模型在 MMLU、HumanEval、GSM8K、MATH、BBH、GPQA 等标准基准上的成绩对比
* MMLU:多任务语言理解 | HumanEval:代码生成 | GSM8K/MATH:数学推理 | BBH:复杂推理 | GPQA:研究生级问答。数据截至 2026 年 7 月,仅供参考。
相关工具
AI 工具☕ 请作者喝杯咖啡
如果这些工具对你有帮助,欢迎赞赏支持~
您的鼓励是我持续更新的最大动力
自愿赠与 | 用于服务器维护 | 不支持退款 | 18岁以上

