Grok 4.7 刚刚在 Harvey LAB-AA v1.1 上排名第一,超越了 Claude Opus 5.5、GPT-6 Astra、Muse Spark 1.3,以及排行榜上的其他模型。
据悉,这个基准测试非常残酷:哪怕出现一个实质性幻觉,整个任务都会被判零分。这不仅仅是关于给出正确答案……而是关于完整正确地完成整个任务,同时不产生实质性幻觉。