一个外卖包装丢进垃圾桶,看起来是一个动作,实际上至少应该被拆成四个动作——塑料餐盒、纸质外壳、金属膜盖、还没倒干净的厨余,如果摄像头只识别出“这是一个餐盒”就完事,分类形同虚设。视觉大模型要真正在垃圾分类里派上用场,得先在识别粒度上比人的第一直觉更细,这也是百家乐AI在设计垃圾识别模块时,最先要解决的问题——识别粒度不够细,后面所有的分类建议都是在一个错误的起点上继续计算。
为什么一个外卖包装,比想象中复杂
随手拆开一份普通外卖:塑料餐盒是主体,盒盖可能是另一种更薄的塑料,封口的塑封膜经常是复合材质,配的塑料勺子、纸巾、酱料包又是各自独立的材料单元,餐盒里剩的汤汁和菜渣则完全不属于可回收范畴。一杯奶茶同样如此:塑料杯身、纸质杯套、塑料杯盖、还有插着的吸管,四种材料贴在一起出现。快递包装是另一个典型例子——纸箱本身可以回收,但箱子内部的气泡膜、缠绕的胶带、印着面单信息的塑料袋,材质各不相同,胶带本身还经常跨越纸箱表面,撕的时候会带下一部分纸箱纤维,进一步增加分类难度。传统的垃圾分类逻辑,习惯把这些东西当成“一件物品”去判断该扔进哪个桶,但一件物品内部往往同时装着可回收和不可回收、甚至好几种不同材质的可回收物,不拆开看,分类这一步从一开始就是错的。生鲜团购包装则是另一种复杂情况——泡沫保温箱、冰袋、防水内袋、外层纸箱叠加在一起,冰袋里的成分可能是水,也可能是化学制冷剂,不能一概而论地当作普通塑料处理,这类包装如果只交给人工凭经验判断,出错的概率并不低。
视觉大模型识别的不是“这是什么”,而是“这是由什么组成的”
百家乐AI的垃圾识别模块,第一步不是给物品贴一个名字标签,而是判断材质构成。视觉大模型会综合表面反光特性(金属通常有明显高光和方向性反射,塑料的反光更均匀柔和)、透光程度(PET材质的透明瓶体和PP材质的半透明餐盒光学特征不同)、印刷标识(瓶底常见的数字回收码、包装上的材质说明文字),以及表面纹理细节,判断出眼前这个区域大概率是哪一类基础材料,而不是仅仅识别出“瓶子”“餐盒”这类物体类别。这套流程实际上分成两步:先在画面里定位出不同的材质区域(类似给图像分块打上边界),再对每个区域单独判断材质类型,输出的不是一个标签,而是一组区域和对应材质的组合。这也意味着训练这样一个模型,需要的不只是“这是什么物品”的标注数据,还需要大量家庭真实场景下、不同光线和污染程度的材质区域标注,这类数据本身的采集和标注成本,比训练一个普通的物体识别模型要高得多。而且家庭场景本身千差万别——厨房灯光的色温、拍摄角度、垃圾桶内部的堆叠遮挡情况,每个家庭都不一样,模型如果只用实验室里拍摄的干净样本训练,搬到真实家庭场景里往往会“水土不服”,识别准确率明显下降,这也是为什么这类模型需要持续用真实使用场景里产生的数据做迭代,而不是训练一次就固定不变。
一个具体场景——一张照片怎么被拆成几个处理动作
举一个模拟场景说明这套流程具体怎么运转。假设用户对着一个刚喝完的奶茶杯拍了一张照片上传,模型先把画面划分成四个区域:杯身、杯套、杯盖、吸管。杯身区域根据透光度和杯底数字标识判断为PET材质,置信度95%,建议清空液体后按塑料类回收;杯套区域根据纸质纹理和不透光特征判断为纸类,置信度89%,但系统同时检测到杯套内侧沾有奶茶渍导致局部区域油污覆盖,标注“建议简单擦拭后再投放,避免污染同批次纸类回收物”;杯盖区域判断为PP材质,置信度91%,提示与杯身分开投放;吸管区域因为透明度和形状特征与常见吸管材质库匹配,判断为塑料吸管,置信度仅68%,低于自动分类阈值,系统弹出提示,请用户确认吸管材质(比如近年部分餐饮门店已经改用纸质或者可降解材质吸管,视觉特征和塑料吸管容易混淆)。这组数据来自模拟测算,用来说明一张照片如何被拆解成多个独立的材质判断和处理建议,而不是输出一个笼统的“奶茶杯,可回收”的结论。
复合材料为什么难拆——瓶身和瓶盖可能根本不是一种材料
很多人以为一个塑料瓶就是“塑料”这一种材料,但矿泉水瓶的瓶身通常是PET,瓶盖多数是PP,缠在瓶身外面的标签套膜又经常是PVC或者PS——三种材质混在一起熔炼回收,会互相污染,导致回收出来的再生料质量下降甚至报废。这也是视觉AI要单独判断瓶盖、瓶身、标签膜是否需要拆开的原因:系统会在识别到“这是一个饮料瓶”之后,进一步提示“瓶盖建议拧下单独处理”,而不是笼统地把整瓶归为一类。更棘手的是复合包装,比如常见的铝塑复合调味品袋、内层带铝箔的牛奶纸盒、多层复合的零食袋,这些材料在生产时把纸、塑料、金属压合在一起,物理上很难无损分离,目前的家庭端回收体系大多也没有能力处理,AI能做的是准确识别出“这是一个复合包装,无法通过常规分类拆解”,引导它进入专门的处理渠道,而不是勉强塞进纸类或塑料类回收,反而污染了那一批本可以正常回收的材料。镀铝膜是其中识别难度最高的一类——表面看起来像金属,实际主体是塑料薄膜加一层极薄的铝镀层,反光特征介于金属和塑料之间,模型在这类材质上的判断置信度普遍偏低,需要更保守地处理。遇到这类材质,系统给出的建议往往是“按不可回收物处理”而不是勉强归入某一类可回收物,因为把它错误地混进可回收物流,造成的后端污染成本,通常比它单独被填埋处理更高,这种“宁可保守判断,不强行归类”的原则,贯穿在整个复合材料识别逻辑里。
厨余垃圾桶里,其实也经常混进不该出现的东西
视觉识别不只是用来判断可回收物的材质,厨余垃圾这一类也需要单独把关。日常生活里,厨余垃圾桶经常被顺手扔进塑料袋、一次性筷子、贝壳骨头这类不属于厨余处理范畴的物品,如果这些混入物比例过高,整袋厨余在后端处理(比如堆肥或者厌氧发酵)时会被拒收,或者需要额外的人工分拣成本。百家乐AI在识别厨余投放画面时,也会检测袋子内是否存在明显的塑料、金属等非厨余材质,如果混入比例超过一定程度,会提示用户“这袋厨余里可能混有塑料袋,建议单独取出后再投放”,而不是等到后端处理环节才发现问题。这个功能容易被忽视,但对于厨余垃圾能不能真正被资源化利用,影响并不比可回收物分类小。
电子垃圾要单独拎出来,别让它混进普通回收流程
废旧电池、充电线、小家电、损坏的电子配件,属于另一条完全不同的处理逻辑——它们可能包含重金属或者存在短路起火风险,混进普通可回收物或者厨余垃圾,都是安全隐患。视觉AI在识别画面时,会针对电池的特定外形轮廓、充电线缆的形态特征、电路板的规则纹路做专门识别,一旦判断为电子类废弃物,会跳过常规的可回收与不可回收二选一逻辑,直接提示按照电子垃圾单独存放。值得注意的是,电子垃圾尤其是锂电池的识别阈值设定和普通材质不一样:系统对疑似电池外形的判断,即便置信度没有达到普通材质自动分类所要求的水平,也会提前触发预警提示,因为误判电子垃圾的后果(安全风险)明显比误判一个塑料瓶更严重,这种“不同类别采用不同风险阈值”的设计,是电子垃圾识别区别于普通材质识别的关键之处。
模型看不准的时候,不猜,而是问
任何视觉模型都有判断不确定的时候,光线不足、包装被压皱变形、表面沾了油渍水渍导致材质反光特征失真,都会让识别置信度下降。百家乐AI给识别结果设置了置信度阈值,只有超过阈值的判断才会自动归类,低于阈值的情况系统不会强行给出一个结论,而是弹出提示让用户简单确认或者重新拍摄一张更清晰的照片——错误的自动分类比不分类的破坏性更大,因为它会把一件本该单独处理的东西,混进一批本来干净的可回收物里,拖累整批的回收质量。举一个模拟场景:某个三口之家一周内的7次外卖订单,产生的包装被摄像头识别为42个独立材料单元,其中35个单元识别置信度超过92%,被自动归类处理;剩下7个单元里,有4个是因为包装表面有明显油渍遮挡了材质纹理,3个是因为拍摄角度导致复合材料的分层结构没有被完整捕捉,置信度都低于70%的自动分类阈值,系统弹窗提示用户手动确认,其中5个经过用户确认后,最终归类和AI的初步判断并不一致。这组数字来自模拟测算,用来说明置信度机制怎样运作,如果实际使用中遇到摄像头持续识别不准的情况,也可以参考摄像头识别排查里从光线、遮挡到包装污染的逐层检查方法。这类置信度阈值本身也不是一成不变的,系统会记录用户手动纠正的记录,用来判断某一类材质的识别模型是不是需要针对性优化。举例来说,如果某一类复合包装(比如某种特定形状的调味品袋)在过去一个月里被多次判定为“低置信度”并且用户纠正的结果高度一致,这类样本会被标记出来,用于后续模型迭代时补充训练,让模型在这一类此前判断不准的材质上逐步改善,而不是永远停留在同一个识别水平上,这也是视觉识别系统需要持续维护、而不是训练完成就一劳永逸的原因。
识别准了,不等于真的回收了
分类识别的准确率再高,也只是整条链路的第一步,一件东西被准确地判断为“可回收纸类”,不代表它最后真的进入了再生纸的生产流程——中间还要看当地是否有对应的回收渠道、回收后的材料是否因为污染程度过高被拒收。这也是为什么百家乐AI把识别准确率和资源回收率分开统计,作为家庭ESG评分里回收维度的两个不同指标。垃圾识别本身也不是孤立的单一模型在工作,而是和判断家庭消耗习惯的预测模型、给出行动建议的决策逻辑共同构成一套多模型协作的系统,视觉模型负责“看清楚材质”,但要不要回收、怎么回收、回收率有没有提升,还需要更多环节的数据配合,而不是用一个“识别对了多少次”的数字,替代真正的资源循环效果。识别只是让“看不清楚”这件事变得可以被记录、被追踪,至于这些被看清楚的材质最后有没有真正回到生产链条里,是一个需要更长时间、更多环节共同验证的问题,也是这类系统接下来要持续改进的方向。