我用2万条真人AI海龟汤游戏数据,评估大模型推理能力哪家强

最近半个月,我一直在秘密做的一个东西,今天终于公之于众了!

这是一个诡异的脑洞:能否用AI游戏来评测大模型的推理能力?为此,我标注了2万条数据,在GPT-4o, Claude,月之暗面,豆包, DeepSeek, MiniMax, 通义千问等11个模型上进行了评测,最终有了答案,文章最后有结果👀
 
 
Back to Top