Moonshot AI 发布 PerceptionBench
从42个现有基准的模型失败案例中,反向提炼出10项原子视觉感知能力(关系、计数、属性、深度、定位、比较、细粒度识别、上下文、OCR、幻觉),构建3000道纯感知、零推理的验证。
彻底隔离感知与推理/知识
目前无模型总分破60%
感知幻觉是所有模型最弱项
真正测的是能不能看清楚。

AI探索 | Hermes/OpenClaw优质资源优质信息
 
 
Back to Top