如果把一个月的购物小票和几张冰箱照片丢给一个语言模型,让它直接算出这个家庭一年产生多少隐含碳,得到的答案大概率是一串听起来合理、实际经不起推敲的数字。家庭ESG判断不是靠更聪明的一句话总结,而是靠足够完整、足够多源的数据打底——这恰好是大模型单独做不到的部分,也是理解百家乐这套系统架构时最容易被忽略的一层。

一个家庭的ESG画像,到底由哪几类数据拼成

百家乐AI在给一个家庭做评估之前,需要接入的数据比大多数人想象的更杂,而且彼此之间几乎没有天然的对应关系:

  • 材料数据:地板、墙面、门窗、家具的材质、厚度与安装年份
  • 食品数据:冰箱库存、保质期、每日消耗与丢弃记录
  • 能源与水数据:分时段用电曲线、用水曲线
  • 环境数据:室内温湿度、空气颗粒物浓度
  • 家电状态数据:压缩机负载、滤网使用时长、开门频率
  • 行为数据:买菜频率、在家时长、作息规律

这六类数据里,前两类通常一次装修或一次采购之后长期不变,中间两类是每天甚至每小时都在刷新的动态数据,最后两类则需要连续观察几周才能沉淀出有意义的规律。少了任何一类,评估出来的都只是半张画像,比如只看能源数据,会误以为一个家庭"很节能",却完全看不到它同时在大量浪费食品和材料。

这些数据的时间尺度完全对不上

材料数据是静态的:一款强化复合地板的隐含碳数值来自生命周期数据库的查表结果,可能几年才更新一次;食品库存数据靠视觉识别加时间戳驱动,一天要刷新好几次;能源和用水数据是分钟级甚至秒级的传感器流;行为数据则要攒够几周甚至几个月才能看出规律。把这四种节奏完全不同的数据直接塞进同一个模型的输入层,光是时间对齐这一步就容易出错——静态数据被当成实时数据处理,或者把某一天偶然的用电波动误判成长期趋势,都是常见的错误方向。举个具体的反例:如果系统把某天因为家里来客人而临时增加的一次用电高峰,当成这个家庭日常能耗基线的一部分,后续所有对比和建议都会跟着跑偏。

数据质量本身也参差不齐,不能假设它天然可信

多源数据还有一个容易被忽视的问题:不同来源的数据可信度不一样。传感器采集的用电、用水数据相对稳定,误差通常很小;但依赖视觉识别的食品库存数据,会受光线、遮挡、包装反光影响,识别置信度可能只有七八成;而完全依赖用户自己填报的部分——比如某件家具是哪年买的、材质具体是什么——准确性参差不齐,有的家庭记得清楚,有的完全凭印象。百家乐的做法是给每一类数据标注置信度而不是一视同仁地使用,遇到低置信度的关键判断时,宁可提示用户确认,也不直接把它当成确定的事实去计算隐含碳或者生成结论。举个例子,如果视觉模型识别冰箱里某种食材的置信度只有0.6左右,系统不会直接把它计入本周消耗统计,而是先标记为"待确认",等下一次识别结果稳定在更高置信度之后,才把它正式纳入趋势计算,避免一次误判连累后续一整条判断链路。除了置信度参差不齐,数据完整性也是常见问题——现实中很少有家庭能凑齐这六类数据的完整记录,尤其是老房子,装修材料的采购凭证早就找不到了,家具也说不清具体是哪一年、用了什么板材。遇到这种情况,比较务实的做法不是拒绝评估,也不是让大模型凭空编一个数字,而是用同类型住宅的统计范围做一个区间估算,并且明确标注这是"估算值"而不是"实测值",两者在后续的评分和建议里权重也不一样——一个精确到具体安装年份的实测数据,和一个靠房龄推算出来的估算区间,得出的建议置信度理应不同。这种分层处理,比假装所有数据都同等可靠更接近真实情况。

大模型擅长的是解释,不是算账

语言模型在归纳、总结、生成自然语言解释上确实有优势,但如果让它直接输出一个材料的隐含碳数值,或者预测下周的厨余重量,风险在于它可能给出一个语法通顺、逻辑自洽、但数字站不住脚的答案——比如凭"经验感觉"编出一个介于合理区间但和真实数据库查表结果并不一致的隐含碳数字。这类错误比"一眼就能看出离谱"的错误更危险,因为不容易被发现,也不容易被用户质疑。百家乐的做法是把数值计算和预测交给专门的模型或者规则明确的查表逻辑,大模型只负责把这些模型的输出整合成用户能看懂的语言,这也是多模型协作要解决的核心问题。

模拟场景:一套三口之家的数据怎样拼成一份判断

以一个模拟家庭为例:客厅与两间卧室铺设的是强化复合地板,材料数据库查得其隐含碳约为每平方米58千克二氧化碳当量,全屋铺装面积82平方米,这部分数据自装修完成后基本固定;冰箱本月记录在案的食材有27种,其中绿叶蔬菜类因存放位置不便、未及时食用,产生厨余约3.6千克,识别置信度在0.85以上;7月空调用电较6月上升41度,对应的分时电价曲线显示上升主要集中在午后高温时段;家庭平均每周采购蔬菜2.3次,其中约四成集中在周末一次性买齐。把这些数据放在一起看,百家乐AI给出的判断不是"少开空调"这类泛化提醒,而是指出:地板的隐含碳已经在装修阶段"沉没",短期内很难改变,真正还有优化空间的是厨余浪费和空调用电这两项——建议把绿叶蔬菜类放进冰箱冷藏区最容易看到的隔层,并把空调设定温度上调1到2度,同时说明这两条建议各自能带来多大的边际改善——比如冷藏区调整预计能把叶菜类厨余从3.6千克降到2千克左右,空调温度上调则对应本月电费和用电量的具体下降幅度,而不是笼统地说一句"这样更环保"。

家庭ESG大模型接入的材料、食品、能源、行为等多源数据示意图
材料、食品、能源与行为数据的时间尺度差异很大,是家庭ESG判断难以由单一模型独立完成的原因之一

数据打通比模型更大更重要

即便材料、食品、能源、行为四类数据各自都有专门的模型处理得很好,如果这些结果之间互不关联,家庭看到的还是四条孤立的提醒,而不是一份连贯的判断。材料数据库算出的隐含碳需要能进入家庭ESG评分,成为一项可以持续追踪的指标;食品浪费和能源数据也需要能在同一条时间轴上对比,才能看出"这个月厨余下降是不是靠牺牲了别的什么换来的"——比如通过减少存货种类降低了厨余,但同时因为频繁补货增加了采购次数和相应的包装消耗,这种此消彼长如果不打通数据是看不出来的。这也是绿色住宅数字孪生在做长期模拟之前必须先解决的前提——如果连当下的数据都没打通,谈何模拟十年之后的变化。

模型可以变大,但数据的宽度决定了判断能不能站得住

行业里经常讨论要不要用参数更大的模型来处理家庭数据,但从实际效果看,参数规模从来不是家庭ESG判断的瓶颈,数据源够不够全、时间尺度能不能对齐、置信度能不能标注清楚、不同模型之间能不能把结果交接明白,才是真正决定评估靠不靠谱的部分。这也是为什么这套系统更适合被理解成"大模型负责理解与解释、时序模型负责预测、视觉模型负责识别、生命周期数据库负责查表、优化算法负责给出取舍"的组合体,而不是一个足够聪明就能替代一切的单一模型。理解了这一点,再去看百家乐后续在具体功能上的设计——评分为什么可解释、建议为什么因家庭而异——会发现这些都不是产品层面的装饰,而是这套多源数据架构自然推导出来的结果。