如果一个家庭AI只知道"客厅灯现在是开着的",它其实谈不上理解家庭。它知道的只是一个开关的物理状态,不知道客厅里有没有人、这个人在做什么、这盏灯还要亮多久合适。家庭AI Agent想要做出得体的判断,前提是先有一套关于"这个家现在是什么样子"的完整表示——这套表示,就是家庭世界模型。

家庭AI现在到底缺什么

市面上大多数智能家居系统,本质上是一堆设备状态的集合:灯是开是关、空调设的多少度、门锁有没有上锁、摄像头有没有检测到移动。这些状态各自独立存放,互相之间没有关联,系统也从不追问"这些状态放在一起意味着什么"。真正缺的不是更多传感器,而是一层把这些碎片状态组织起来、能够回答"现在这个家里正在发生什么"的中间表示。没有这一层,AI能做的最多是"看到A就触发B"的条件反射,永远到不了"理解当下情境再做判断"的程度。

传统传感器为什么只能看到"点",数据又该从哪里来

一个门磁传感器只会报告"门开了"或"门关了",它不知道是谁开的门、开门之后这个人去了哪里、这次开门和十分钟前的另一次开门是不是同一个人的连续动作。一个人体传感器只会报告"检测到移动",它不知道这是家里的老人、小孩,还是宠物,也不知道这个移动是不是异常的。这些传感器提供的都是孤立的"点状事件",缺少把点连成线的能力。家庭世界模型要做的,正是把这些散落的点状事件,按照空间、时间、人物身份重新串联起来,变成一条条可以理解的行为线索,而不是让AI面对一堆互不相干的开关状态日志。

把点连成线,需要的输入本身也要足够丰富。一个家庭里能贡献信息的来源至少包括:门窗磁贴报告的开合事件、毫米波雷达提供的无接触人体存在与粗略姿态、摄像头在获得授权范围内提供的场景与动作信息、家电自身上报的运行日志(比如洗衣机进入脱水阶段、烤箱到达设定温度)、能耗监测提供的用电曲线变化,以及支持Matter协议的设备之间可以互相读取的标准化状态字段。这些来源单独看都很有限——门磁不知道是谁开的门,能耗曲线不知道具体在用哪个电器的哪个功能——但把它们在时间轴上对齐之后,很多原本模糊的情况会变得清晰:比如同一时间段内厨房用电骤增、抽油烟机被启动、冰箱门被打开关闭三次,组合起来大概率就是"正在准备一餐饭",这是任何单一传感器都得不出的结论。也正因为如此,家庭世界模型的搭建更依赖多种数据源之间的交叉验证,而不是单纯堆高某一类传感器的精度或数量——一个再精准的摄像头,也回答不了"冰箱门刚才是不是被打开过"这种问题。

家庭世界模型需要记录哪些状态,又该如何认出"是谁"

一个可用的家庭世界模型,至少要同时维护这样几类信息:

  • 空间层面:房屋结构、房间边界与设备所在位置的地图
  • 人物层面:家庭成员身份、大致位置、在家或外出状态
  • 设备层面:每个受控设备当前的运行参数与健康状态
  • 事件层面:正在发生的活动,比如"客厅有人在看电视""厨房炉灶正在使用"
  • 历史层面:过去一段时间内发生过的事件序列与持续时长
  • 预测层面:基于以上信息对接下来几分钟到几小时可能发生的情况做出的短期推断

这几类信息缺一不可:只有空间和设备状态、没有人物和事件,AI只是一张更详细的设备清单;只有当下状态、没有历史序列,AI就无法判断一个状态是刚刚发生还是已经持续了很久,也就谈不上合理地介入;而没有预测层,模型就只能一直被动地描述现状,永远快不过用户实际遇到的问题。这六类信息也不是各自独立存放的表格,而应该是彼此可以互相查询的关联结构——比如通过一次事件反查当时在场的人物、当时相关设备的状态,这种可回溯性正是家庭世界模型区别于普通日志系统的地方。

家庭世界模型里最容易被低估的一个难点,是人物身份的识别精度。毫米波雷达能可靠地判断某个区域有没有人体存在,却分不清是家里的老人还是刚放学回家的孩子;普通人体红外传感器甚至会把体型较大的宠物误判为人。如果每一次身份判断都依赖持续运行的人脸识别,又会带来明显的隐私顾虑,且客人来访、孩子逐渐长高、家庭成员戴口罩或帽子这些常见情况都会让识别变得不稳定。更现实的做法是把多种弱信号组合起来做身份推断:手机是否连接在家庭网络的固定位置、智能穿戴设备的蓝牙信标、常态化的活动轨迹与作息规律,只有在需要高置信度判断(比如涉及安防的关键动作)时,才启用更强的视觉识别手段,并且识别过程尽量留在本地完成。这种"多数时候用弱信号做粗判断、少数关键场景才启用强识别"的分层策略,比长期开启单一识别方式更平衡。

时序信息为什么比即时状态更重要

"客厅灯亮着"这五个字本身几乎不携带任何决策价值,因为亮着可以是任何原因。但如果补上时序信息——"客厅灯从晚上七点持续亮到十一点,期间客厅一直检测到一人的正常活动轨迹,电视也保持在播放状态"——这句话就足够支撑一个判断:这是一个人正常在看电视,不应该被误判为"忘记关灯"而强制关闭。反过来,如果时序信息显示"客厅灯十一点仍亮着,但过去四十分钟客厅没有任何人体活动,卧室方向传感器显示两位家庭成员都已进入睡眠状态",同样是"灯亮着",这时候提醒或自动关闭就是合理的。区别不在于灯这个设备本身,而在于AI有没有能力把"现在"放进"过去一段时间"的序列里去解读。这也是为什么家庭世界模型必须是时序模型,而不是只刷新最新一帧状态的快照表。

世界模型如何帮助AI预测下一步

有了持续更新的状态序列,AI才有基础去做短期预测,而不是每次都被动等指令。比如系统观察到某位家庭成员已经在书房连续伏案两个多小时没有起身走动,结合这位成员过去的行为习惯——通常连续工作一个半小时左右会起身倒水或去阳台,世界模型可以把"接下来几分钟大概率会短暂离开书房"标记为一个高置信度的预测,从而提前把书房到厨房沿途的照明调整到合适亮度,而不是等人体传感器触发了才手忙脚乱地开灯。这种预测能力和数字孪生环境里的推演是互补的关系:世界模型负责准确刻画"现在和刚刚发生了什么",数字孪生则可以在这个基础上进一步模拟"如果现在采取某个动作,几分钟后会变成什么样子",两者共同支撑更靠谱的主动决策,而不是等真实设备出错之后再补救。类似的预测逻辑也能用在更长的时间尺度上:如果世界模型记录到某个房间的除湿设备连续多天运行时长比历史均值明显拉长,同时窗户开合频率没有变化,这可能提示墙体或窗缝的密封状态正在变化,值得提醒用户关注,而不是等到某一天设备直接报警才发现问题——这类基于状态偏移而非单点报警的判断,本质上也是建立在持续、准确的时序记录之上。

一个具体例子:晚上十一点,客厅只有一人在看电影

把这套模型放进一个具体场景更容易理解它的价值。假设当前时间是晚上十一点,家庭世界模型综合客厅的人体存在传感器、电视播放状态、灯光亮度、以及卧室方向摄像层和门磁的信息,得出这样一个情境描述:客厅有一位成员,处于观影状态,电视音量适中,灯光已调至观影模式;另外两位家庭成员的卧室灯光已关闭超过三十分钟,且卧室方向再无人体活动记录,符合已入睡状态。如果这时候有一个"晚安模式"被误触发,一套只认设备状态、不认情境的系统很可能会把全屋灯光统一调暗或关闭,客厅这位还在看电影的成员反而被打扰。而具备世界模型的系统会先确认当前情境——客厅仍有正常活动的成员,晚安模式此时只应作用于已确认无人活动的区域,客厅的灯光和电视维持原状。这个判断能不能做对,完全取决于AI是不是真正"知道"客厅现在是什么情况,而不是只知道客厅灯的开关状态。同样的模型如果拉长到一周的尺度上看,还能发现更细的规律:比如这户人家周五晚上比工作日普遍晚睡四十分钟左右,宠物在晚间十点前后固定会有一次去阳台方向活动的轨迹,这些规律一旦被沉淀下来,"晚安模式该在几点触发""要不要把阳台方向的感应灯单独排除在自动关闭范围之外"这类判断就能变得更贴合这户人家的真实作息,而不是套用一套所有家庭通用的默认参数。

家庭世界模型整合空间地图、人物位置、设备状态与历史事件的示意图
家庭世界模型把空间、人物、设备与事件序列整合成统一的情境表示

值得说清楚的是,家庭世界模型描述的是"客厅有一人在观影"这类结构化情境信息,而不是要求把摄像头原始画面持续外传做集中分析。大部分用于构建这层情境的推理,完全可以在家庭本地设备上完成,只有真正需要更强算力的复杂推理,才有必要把脱敏后的状态摘要送到云端处理。这也是为什么家庭世界模型的建设,天然要和本地优先的处理架构绑在一起考虑,而不是简单地"数据越多越好、都传上去再说"。至于哪些判断适合放在设备本地完成、哪些必须依赖更强算力,是一个独立的架构问题,值得单独展开讨论。

情境信息不必事事上传,却是家庭AI Agent做决策的地基

回到最初的问题:一个只知道设备开关状态的系统,永远没办法回答"现在该不该做这件事",因为它根本不知道"现在"是什么样子。家庭AI Agent的任务规划能力再强,如果建立在一份不准确、不完整的家庭情境认知上,规划出来的动作也可能是错的甚至添乱。摄像头和传感器采集到的画面与数据,需要被理解成人物、事件和状态,这一层理解能力我们在多模态视觉大模型如何理解家庭事件中有更具体的展开。可以说,家庭世界模型不是一个锦上添花的功能模块,而是所有上层判断——无论是任务规划、预测维护还是安全预警——共同依赖的那一层地基,这层地基搭得扎不扎实,直接决定了一个自称"家庭AI"的系统,到底是真的理解这个家,还是只是记住了几十个开关的状态。判断的标准也很简单:把摄像头、传感器和设备日志全部断开一分钟,问问这套系统还能不能说清楚"家里现在是什么情况"——答不上来,说明它依赖的只是实时状态查询;答得上来,说明背后确实有一份持续维护、经得起追问的家庭情境记录在支撑。