幻兹快讯
Grok 4.7 在 Harvey LAB-AA v1.1 上排名第一
幻兹快讯
2026年10月10日
阅读 14 次

Grok 4.7 刚刚在 Harvey LAB-AA v1.1 上排名第一,超越了 Claude Opus 5.5、GPT-6 Astra、Muse Spark 1.3,以及排行榜上的其他模型。

据悉,这个基准测试非常残酷:哪怕出现一个实质性幻觉,整个任务都会被判零分。这不仅仅是关于给出正确答案……而是关于完整正确地完成整个任务,同时不产生实质性幻觉。

Copyright © 幻兹网 All Rights Reserved粤ICP备2026034579号粤公网安备44030002012995号
☰