当前主流世界模型(Sora、Genie 3、JEPA、Marble)的状态空间只编码物体、位置、遮挡与运动,缺少'人相信发生了什么'的表征——例如杯子在人离开房间时被移入柜子,纯物理模型看不出任何异常,却无法推断此人回来后会去哪里找。论文提出心智世界建模(Mental World Modeling)框架,将信念、注意力、意图、情绪与社会规范纳入状态,并把每个动作拆分为物理载体与心智载荷;配套实现MENTIS无需额外训练,通过场景解析、第一视角渲染与动作分解进行双状态并行推理。对服务机器人与协作智能体而言,这是当前世界模型热潮中少有人补上的关键缺失层。