Abhay Sheel Anand 最新论文
Anand 等人发现基础模型在时钟绘制测试中达94%准确率,但分解为24个认知问题后,准确率从88%大幅下降至46%,揭示标准指标掩盖模型信息处理缺陷。
https://hci.top/zh/authors/36229?source=all