← Index
#benchmarks
10 articles
2026-07-18
Kimi K3 模型与鹈鹕基准测试的启示
AI · 2026-07-18
8/10
Kaggle AGI 竞赛评选过程不一致的指控
AI · 2026-07-18
7/10
2026-07-11
谷歌在预测市场上拥有最佳数学 AI 模型的概率飙升 35.5%
Polymarket · 2026-07-11
8/10
OpenAI 下一代 GPT 模型得分赌注暴跌至 1.1%
Polymarket · 2026-07-11
7/10
2026-07-10
OpenAI 下一代 GPT 模型竞技场得分赔率升至 87%
Polymarket · 2026-07-10
6/10
2026-07-09
OpenAI 揭露 SWE-Bench Pro 基准测试缺陷
AI · 2026-07-09
7/10
2026-06-30
Qwen 3.6 27B:本地 AI 开发的理想选择
AI · 2026-06-30
8/10
2026-06-29
GLM 5.2 在网络安全基准测试中超越 Claude
AI · 2026-06-29
8/10
2026-06-21
Google 数学 AI 模型在 Polymarket 上的胜率飙升至 79.5%
Polymarket · 2026-06-21
5/10
2026-05-28
IBM 与 Artificial Analysis 的 ITBench-AA:前沿模型得分低于 50%
AI · 2026-05-28
8/10