AI探索指南
03:31 · 2024年8月9日 · 周五
我用2万条真人AI海龟汤游戏数据,评估大模型推理能力哪家强
最近半个月,我一直在秘密做的一个东西,今天终于公之于众了!
这是一个诡异的脑洞:能否用AI游戏来评测大模型的推理能力?为此,我标注了2万条数据,在GPT-4o, Claude,月之暗面,豆包, DeepSeek, MiniMax, 通义千问等11个模型上进行了评测,最终有了答案,文章最后有结果
👀
Home
Powered by
BroadcastChannel
&
Sepia