现在市面上所有的"智能家居设备",本质上都有一个共同的物理特征:它们不会动。灯泡固定在灯座里,空调挂在墙上,门锁焊在门框上,能变的只是它们的开关状态和参数。百家乐这几年在做的AIoT,说到底是在把"不会动的东西"接进AI系统里,让它们按感知结果自动切换状态。而家庭机器人一旦真正接入这套系统,打破的正是这条边界——AI第一次要指挥一个会在三维空间里移动、抓取、搬运真实物体的执行体,这已经不是加几个API接口能解决的问题,而是一次范式转移,行业里把这个方向叫做Physical AI。
智能家居目前的天花板:只能控制"不会动"的东西
回顾一下现在一套完整智能家居能做的事情:识别到有人回家,开灯;检测到室温过高,启动空调;感应到门口有人刷卡,开锁;语音说"打开电视",切换电视电源。这些动作背后的逻辑模式高度一致——识别一个状态,切换一个固定设备的输出。设备本身不需要知道自己在房间里的哪个位置,不需要规划一条移动路径,不需要判断该用多大力气去抓一个东西。它只需要响应一条指令,执行一次开关或者调参。这套逻辑撑起了过去十年绝大部分"智能家居"的产品形态,但它有一个天然的上限:凡是需要改变物体空间位置、需要在环境中移动、需要用力操作实物的任务,现有智能家居设备完全无能为力。老人水杯没水了,AI能感知到,但没有任何一个灯泡或者空调能帮忙把水端过去;地上有一件衣服掉了,摄像头能识别出来,但没有一个门锁或者窗帘能弯腰把它捡起来。感知和执行之间,一直隔着这条"能不能触碰和移动物理世界"的鸿沟,过去十年智能家居的进步基本都发生在鸿沟的感知一侧,执行一侧几乎没有跨过去。
Physical AI和Embodied AI,跟AI音箱的差别到底在哪
一个AI音箱识别出"打开客厅灯"这句话,调用一次Function Calling接口,任务就结束了,整个过程不涉及任何物理空间推理。而具身智能(Embodied AI)要处理的问题完全是另一个维度:它需要先在三维空间里定位自己和目标物体的相对位置,规划一条不会撞到茶几、宠物或者正在走动的人的移动路径,靠近目标后还要计算用多大的抓取力度才能拿稳一个可能很滑的玻璃杯而不捏碎它,倒水时要控制倾斜角度和速度避免溢出,全程还要应对环境中随时可能出现的动态变化——比如小孩突然跑过来。支撑这类任务的技术路线里,VLA(Vision-Language-Action)模型是目前最受关注的方向:它接收视觉画面和语言指令作为输入,直接输出连续的动作序列(关节角度、抓取力度、移动轨迹),而不是像传统智能家居那样输出一条离散的API调用。这意味着机器人的"思考"和"动手"之间不再有一层简单的指令映射,而是一个需要连续感知、连续调整的闭环控制过程。也正因为这样,家庭机器人实际上需要两层"大脑"协同工作:一层是家庭层面的世界模型,负责理解任务背景、判断该不该做、什么时候做合适;另一层是机器人自身的具身世界模型,负责把一个笼统的任务拆解成几十上百个连续的动作指令,并且在执行过程中根据实时视觉反馈不断修正。这两层如果混在一起处理,会导致系统既要操心"老人是不是介意被打扰"这种语义判断,又要操心"手腕该转多少度"这种运动控制细节,耦合度太高,任何一边出错都会波及全局,工程上通常会把它们拆成独立的两个层级分别优化。
一个具体场景:水杯空了,机器人怎么完成"取杯-接水-送回"
模拟场景:下午三点,家里的老人独自坐在客厅沙发上看电视,茶几上的水杯已经见底。百家乐的家庭摄像头结合杯体重量感应的智能杯垫,判断出水杯处于"空杯超过40分钟未续水"的状态,同时通过存在感应确认老人一直坐在沙发区域没有起身。这个判断本身由家庭世界模型完成,它知道杯子在哪张茶几上、老人在哪个位置、厨房和饮水机分别在什么方位、当前家里有没有其他人可以顺手帮忙。世界模型把这个需求拆解成一个粗粒度任务下发给机器人:"前往客厅茶几,取走水杯,前往厨房饮水机接水,返回并放回原位,动作过程中避免打扰老人观看电视"。接下来的执行完全交给机器人自身的具身控制系统:规划从当前位置到茶几的移动路径、识别水杯的具体位置和姿态、计算合适的抓取角度和力度、绕开沙发和地上的宠物、在饮水机前完成对齐和出水量控制、原路返回时放慢速度避免晃洒。整个过程里,家庭大脑负责"知道要做什么和为什么",机器人负责"知道具体怎么做",两者的分工非常清楚,也是这套系统能不能真正跑起来的关键。这个场景里还有一个容易被忽略的细节:如果机器人在接水途中发现老人已经起身走向厨房,家庭世界模型会立刻把这个新信息同步给机器人,任务可能从"送水到客厅"实时改成"直接把水杯递给正在厨房的老人",甚至判断没必要再送——如果老人本来就是要去厨房接水。这种基于最新状态的动态调整,比一开始把整个任务写死成一串固定步骤要复杂得多,也更能体现"感知-决策-执行"是一个持续过程,而不是一次性下达指令就结束。
摄像头和传感器不再只是给人看监控,而是给机器人当眼睛
这次升级里一个容易被忽略但很关键的变化是:原本只用来做安防监控和自动化触发的家庭摄像头、毫米波雷达、门窗传感器,会同时成为机器人的环境感知系统。传统服务机器人进入一个陌生环境,需要自己用激光雷达和摄像头重新扫描建图,也就是常说的SLAM过程,这个过程既耗时又容易在光线复杂、家具经常挪动的家庭环境里出错。但如果家里已经有一套长期运行、持续更新的多模态视觉家庭模型,机器人完全可以直接复用这套已经建好的语义地图——哪里是客厅、哪里是厨房、茶几和沙发的固定位置、哪个房间此刻有人不宜贸然进入——而不必从零开始重新认识这个家。反过来,机器人在移动过程中采集到的近距离、低视角数据,也可以补充固定摄像头看不到的死角信息,两者形成互补而不是简单的谁替代谁。这也带来一个必须正视的隐私问题:当感知系统同时服务于安防、自动化和机器人导航三种用途时,数据的使用边界、存储时长、是否允许云端上传,都需要比现在更明确的规则,不能因为多了一个"更聪明的用途"就默认放宽隐私标准。
机器人和智能家居的边界正在消失
过去,"智能家居"和"服务机器人"几乎是两条不相干的产业线:一个做固定安装的传感器和执行器,一个做能移动的独立机器。这种分割正在失去意义。一个更合理的架构是:家庭层面维持一个统一的世界模型和任务队列,机器人只是这套系统里众多"执行体"中的一种,跟灯光、空调、门锁地位相同——只是机器人的执行能力从"切换状态"升级成了"移动和操作"。这也意味着机器人可以和固定设备联动完成任务:机器人晚上巡视时可以请求智能灯光提前点亮它即将经过的走廊,避免绊倒;机器人要出门取快递时可以直接联动智能门锁完成开门,不需要自己长机械臂去拧锁。当固定设备负责感知和环境控制、移动机器人负责空间操作,二者共享同一套家庭世界模型和任务规划器时,智能家居和家庭机器人在系统架构上其实已经是一体的,只是外部还习惯把它们叫成两个产品品类。再往前一步,多个机器人和多类固定设备之间也需要协调而不是各自为战:如果家里同时有一台清洁机器人和一台服务机器人,世界模型需要知道两者当前的位置和任务状态,避免清洁机器人在服务机器人正在搬运水杯的路径上迎面撞上;如果服务机器人正在充电,而老人此时呼叫送水,系统也需要判断是继续等待充电还是中断去执行,这类资源调度问题和多个家庭Agent之间协同分工的逻辑其实是相通的,只是多了一个物理空间冲突的维度。
这条路还很难走:具身智能目前的真实限制
把这套场景说清楚,不代表它已经成熟。现实的限制至少包括:机器人对形状不规则、材质易碎或者表面湿滑物体的抓取成功率,目前在实验室之外的复杂家庭环境里还远谈不上稳定;VLA这类模型的实时推理对算力要求很高,如果完全依赖云端处理,网络延迟会直接影响动作的连续性和安全性,这也是为什么端侧AI能力会成为家庭机器人能不能真正落地的前提之一;机器人在老人、儿童、宠物身边活动,任何一次误判都可能造成实际的物理伤害,安全冗余设计和失败恢复机制(比如检测到抓取失败要能安全地重新尝试而不是硬来)必须做得比工业机器人更保守;真实家庭场景的多样性——户型、家具摆放、光照条件千差万别——导致训练数据的覆盖面永远不够,模型在陌生环境里的"模拟到现实"的迁移能力(sim-to-real gap)依然是一个尚未被彻底解决的研究难题;机器人本身的成本、续航和噪音,也决定了它短期内更适合承担一部分明确、重复、风险可控的任务,而不是完全替代人。此外,责任归属也是一个绕不开的现实问题:如果机器人在搬运热水途中判断失误造成烫伤,故障到底出在感知环节的误判、动作规划的偏差,还是家庭世界模型下达的任务本身有问题,这类事故的原因链条会比一次自动化规则出错复杂得多,也需要一套专门的日志和回溯机制才能说清楚责任在哪一层。
智能家居的终点,可能根本不是"家居"
如果把时间线拉长来看,AIoT解决的是"让固定设备变聪明",Physical AI要解决的是"让家庭AI拥有一具可以移动和操作的身体"。这两者一旦在同一套世界模型下打通,家庭AI系统会从一堆分散的智能设备,逐渐收敛成一个统一的、既能感知又能行动的整体——这时候还叫它"智能家居"其实已经不太准确,它更接近一个部署在家庭这个具体空间里的物理智能体系统。百家乐现在做的每一步AIoT升级,包括让摄像头理解事件、让世界模型记住物品和人的位置、让端侧算力支撑实时决策,都是在为未来某一天机器人真正走进这套系统做准备,而不是两条互不相干的产品线各自往前跑。