刷分
分类
作弊
他的回应也很有意思,说SemiAnalysis指控他们刷分作弊的论点是愚蠢的,因为OpenAI也是这样,GPT-5.6Sol大模型在难度较低的TerminalBench2.1跑分是88.8%,但在难度更高的TerminalBench4.0中也也只有37.3%。
文章
对于跑分作弊的指责,没看到谷歌Gemini那边的回应,但Meta这边的AI业务主管AlexandrWang先坐不住了,他是ScaleAI数据标注业务的创始人,被Meta重金收购之后成为MetaAI业务的实际当家人,Spark等大模型就是他领导下做出来的,当然不会接受被人说是刷分作弊才能拿到高分的。
文章