大多数家庭摄像头的推送消息长这样:"检测到人体移动",一天推十几条,用户看了几次之后就把通知关掉了,摄像头继续录着,但已经没有人再看。问题不在摄像头拍得清不清楚,而在于它只会做一件事——判断画面里有没有东西在动。它分不清这是主人下班回家,还是陌生人在门口徘徊;分不清老人在厨房是正常做饭,还是摔倒后一直没起身。摄像头不缺"看见"的能力,缺的是"看懂"的能力,这正是多模态视觉大模型要补上的一层。

"检测到人"这四个字,到底缺了VLM在看的什么东西

传统摄像头背后跑的是目标检测模型,输出的是"这一帧画面里有一个人形边界框",仅此而已。它不知道这个人是谁、在做什么动作、这个动作是不是符合这个时间点、这个地点的正常情况。于是所有信息都被压缩成一条通知——"检测到移动"——用户拿到这条通知,仍然要自己脑补剩下所有信息:是谁、在干嘛、要不要管。这也是"提醒疲劳"的根源:当一条通知需要用户自己完成大部分判断工作时,通知本身的价值就非常有限,用户很快会选择性忽略,等到真正需要关注的一次事件发生时,往往也被淹没在过去几十条无意义提醒里。

多模态视觉大模型处理的不是单帧画面里的物体分类,而是一段时间内的场景、动作和上下文的组合。它同时读入连续帧的画面信息、当前时间、这个空间过去的历史行为模式,以及同一时刻其他设备的状态,输出的是一句可以直接理解的事件描述,而不是一个边界框坐标。比如同样是"厨房里有一个人",如果结合了炉灶开关状态、这个人已经停留的时长、以及这户人家过去在厨房的平均停留时间,模型可以给出"老人进入厨房已十八分钟,超出该时段历史平均停留时长两倍以上,且炉灶处于开启状态"这样一句真正带判断力的描述,而不是反复推送"检测到移动"。这种从像素到语义的跨越,才是VLM相对于传统计算机视觉模型的核心差异。

案例一:老人进厨房多久没出来算异常,为什么要多模态一起判断

把这类判断具体化会更清楚它是怎么工作的。假设某位老年家庭成员在下午四点进入厨房,系统结合这户人家过去三十天同一时段的历史数据,发现这个时间点的平均厨房停留时长是十二分钟,标准差不大。如果这次停留超过二十五分钟仍未离开,且炉灶始终处于开启状态、期间没有检测到明显的走动或操作动作,系统会把这次事件标记为需要关注,先通过语音在家中轻声询问是否一切正常,只有在没有得到回应的情况下,才会升级为向紧急联系人发送提醒。这个过程里,"多久算异常"不是写死的固定阈值,而是基于这户人家自身的历史行为分布动态计算出来的,同一个时长放到另一户经常在厨房长时间准备食物的家庭里,可能完全算不上异常。这也意味着系统在刚安装的头几周,判断的准确度会明显低于运行几个月之后——没有足够的历史行为数据作为参照系,任何"多久算异常"的门槛都只能先用一个偏保守的通用值顶上,随着数据积累再逐步收窄到贴合这户人家实际作息的区间。

"多模态"这三个字在这里不是宣传用语,而是实际的工程约束。纯视觉判断在很多真实场景里会遇到麻烦:光线昏暗、人被家具遮挡一部分、镜头角度刚好拍不到关键动作,任何一种情况都可能让单纯基于画面的判断出错。更稳妥的做法是把视觉信号和其他模态放在一起交叉验证——比如麦克风采集到一声沉闷的撞击声,紧接着视觉画面里出现一段时间没有正常站立姿态的人体轮廓,两个信号同时出现,系统对"可能发生跌倒"这个判断的置信度会明显高于只依赖其中一种信号。反过来,如果只是听到较大声响但视觉上人体姿态一直保持正常走动,系统会倾向于判断这是物品掉落而不是人员意外,不会贸然升级为紧急提醒。声音、画面、设备状态、历史行为数据放在一起做联合判断,是降低误报率最直接的办法,也是"多模态"真正要解决的问题,而不是简单地把摄像头像素调得更高。

案例二:快递、书包和一只喝水次数不对的猫

类似的理解能力可以覆盖很多琐碎但真实的家庭场景。快递员把包裹放在门口离开后,系统能够识别出"物品已放置在门口且无人取走",在合适的时间通过App提醒,而不是只留下一条无人能看懂的"检测到移动"记录;孩子放学回家,系统能从进门动作和书包放置位置的变化中,推断出"孩子已到家,书包留在客厅未带回房间",作为家长关心但不紧急的一条状态记录,而不是安防级别的提醒;宠物方面,系统可以统计一只猫每天靠近饮水器的次数和实际饮水的持续时长,如果连续几天出现"靠近次数正常但有效饮水时长明显下降"的模式,这往往是健康问题的早期信号,比人眼偶尔瞥一眼水碗更容易发现规律性的变化。这些场景没有一个是靠"检测到移动"能覆盖的,都需要把动作、物体、位置和时间序列放在一起推理。

用一句话搜家庭视频:"昨晚是谁最后关的阳台门"

VLM带来的另一层变化,是家庭视频从"只能按时间轴倒着翻"变成"可以直接用自然语言提问"。用户问"昨天晚上是谁最后关的阳台门",系统需要先把这句话拆解成几个检索条件:时间范围锁定在昨晚、目标动作是"关闭"、目标物体是"阳台门",然后在这个时间窗口内,结合门磁传感器记录的开合时间点、以及对应时间段内的视觉识别结果,交叉比对出当时在阳台附近出现过的人物身份,最终给出一个有依据的回答,而不是简单地把一段监控录像丢给用户自己看。这种检索能力背后依赖的是视频内容被提前结构化索引——每一段画面对应的人物、动作、地点和时间都被标注成可检索的条目,这也是我们在家庭知识图谱中讨论的结构化数据组织方式在视觉领域的延伸,如果视频只是原始像素堆在硬盘里,再强的大模型也没办法在几秒钟内给出准确答案。这类查询通常还需要处理更模糊的提问方式,比如用户不一定记得准确的物体名称,可能会问"昨天那个穿蓝色外套的人是几点走的",系统需要先在视觉特征里定位"蓝色外套"这个模糊描述对应的具体身份或访客记录,再关联到对应的时间点和门禁记录,这种模糊匹配能力比精确关键词搜索要求更高,也是纯粹的视频存储方案完全无法提供的。这种检索体验也在悄悄改变家庭视频的使用方式:过去摄像头录像更多是出事之后才被翻出来查证的证据,现在则更像一份可以随时提问的家庭日志,用户想确认的往往不是"有没有异常",而是一个具体的生活细节。

识别不是100%准确的,隐私也不是事后补丁

必须承认的一点是,视觉理解不可能做到永远正确。逆光、遮挡、多人重叠在同一画面、儿童和身材娇小的成年人在部分角度下的误判,这些都是真实存在的技术局限,不该被回避或者夸大解决程度。一个负责任的设计,是让系统在置信度不够高的时候,倾向于给出较低强度的响应而不是武断下结论——比如无法确定画面中的人物身份时,先按"未识别访客"处理并保留画面供事后确认,而不是随意归类为某个家庭成员或直接判定为异常入侵。同样,遇到跌倒疑似事件但视觉证据不充分时,系统应该先通过语音询问代替直接呼叫紧急联系人,把误报的代价和漏报的代价都纳入考虑,而不是简单地把阈值调到最敏感就当作万事大吉。

视觉理解能力越强,隐私上的顾虑也越现实,这一层不能等系统做完了再补救。合理的做法是把大部分识别推理放在家庭本地设备上完成,原始视频画面默认不离开本地存储,上传到云端的只是脱敏后的事件摘要而不是画面本身,这一点和我们在端侧AI架构里讨论的分层处理逻辑是一致的。另外,用户应该能明确设定哪些区域完全不做识别或不录制——卧室、浴室这类空间即便安装了摄像头,也应该支持默认屏蔽或只保留极低精度的存在感应,而不是默认全量分析。对于家里的访客,是否被纳入身份识别范围也应该是可以关闭的选项,而不是默认对所有出现在画面里的人一视同仁地建立档案。视觉理解能力是用来解决具体问题的,不是用来把一个家庭事无巨细地记录下来的。

家庭摄像头画面从目标检测升级为多模态事件理解的处理流程示意图
从像素识别到事件理解,中间需要经过场景、动作与历史数据的联合推理

留存策略同样需要分层设计:大部分原始视频只在本地保留较短时间用于事后核查,超过这个时间窗口自动清除;只有被标记为需要关注的事件片段,才会被单独保存更长时间,并且这类保存也应该明确告知用户、允许用户随时删除。这种"默认短期本地留存、异常事件才延长保存"的策略,比"全部录像永久保存"更符合实际需要,也大幅降低了长期积累的隐私风险。

什么时候该提醒,什么时候不该打扰

比识别准确率更难的,其实是"要不要说"这个判断。如果系统把每一次识别到的轻微异常都推送给用户,很快会退化回"检测到移动"式的骚扰通知,只是文字更长了而已。更合理的策略是分级处理:日常的、在历史正常范围内波动的事件,只静默记录进家庭状态历史,不主动打扰;明显偏离历史模式但风险较低的事件,比如书包忘在客厅,用低优先级的方式在合适时机呈现;只有涉及安全或健康风险、且系统评估置信度较高的情况,才升级为主动提醒甚至紧急通知。这个分级门槛也不是一次性设定就不变的,而应该随着系统对这户家庭历史模式理解得越来越准确而持续校准——理解一个家庭需要时间,识别能力再强,也急不来这一步。

视觉理解只是输入层,真正的判断发生在更上一层

摄像头和麦克风看懂了"发生了什么",这件事本身还不等于家庭AI做出了正确决策,它只是给上层判断提供了一份可靠的原始素材。这些事件描述最终要汇入我们在家庭世界模型中讨论的那套统一情境记录里,和门磁、温湿度、设备日志一起,构成AI理解"现在家里是什么情况"的完整依据;而要不要因为一次识别结果去调整某个设备、要不要打断正在进行的其他任务,这类具体行动的取舍则属于家庭AI Agent的任务规划范畴。视觉大模型解决的是"看懂"的问题,看懂之后该怎么办,是另一层需要单独设计的责任边界,把这两层混为一谈,是很多产品把"能识别"直接等同于"够智能"的常见误区。