OpenToM基准介绍
时间: 2026-09-02 03:49:58
(部分内容来自网络,其真实性存疑,为了避免对您造成误导,请谨慎甄别。)
根据搜索结果,OpenToM 是一个专门用于评估大语言模型(LLMs)“心智理论”(Theory of Mind, ToM)能力的基准测试数据集。
* 核心目标:测试LLM是否能理解故事中角色的心理状态(信念、意图、态度等),而不是简单依赖文本中的词句对应。
* 关键设计:包含长叙事、有明确性格和动机的拟人化角色,以及多类型问题(如对物理位置的信念、基于社会常识的多步推理、对事件的心理态度)。
* 注意事项:它被严格设计为测试专用,严禁用于模型训练或微调,以免影响评估的公平性。
其他补充:搜索结果中还提到一个拼写相似的开源项目 OpenTomb(无字母“o”),它是《古墓丽影》经典游戏引擎的开源重制版,注意不要与 AI 评测基准 OpenToM 混淆。