
在采后农业加工阶段的蔬菜分拣过程需要准确性和效率。众所周知,人工分拣技术常常导致不一致性、成本增加和食物浪费。为了解决这一问题,当前研究建议采用一种新技术,即利用自监督学习(Self-Supervised Learning, SSL)和目标检测(Object
在采后农业加工阶段的蔬菜分拣过程需要准确性和效率。众所周知,人工分拣技术常常导致不一致性、成本增加和食物浪费。为了解决这一问题,当前研究建议采用一种新技术,即利用自监督学习(Self-Supervised Learning, SSL)和目标检测(Object Detection)以及机器人操作(Robotic Manipulation)的视觉引导机器人自动蔬菜分拣。研究人员生成了一个无偏数据集,包含来自八种蔬菜类型的4,640张图像,并带有新鲜和损坏的子类别。首先,通过5折交叉验证比较了YOLOv10s、YOLOv11s和YOLOv12s三个模型,以确定哪个监督基线在定位方面表现更好。其中,YOLOv12s表现最佳,达到了99.01?±?0.27%的mAP50和82.29?±?0.52%的mAP50–95。为了增强特征鲁棒性并减少对大数据集的依赖,研究人员应用了自监督预训练,例如DINOv2风格、BYOL和MAE训练。在SSL预训练方法中,DINOv2风格预训练的YOLOv12s取得了最佳整体性能,精确率为98.35%,召回率为98.97%,F1分数为98.65%,mAP50为98.83%,mAP50–95为82.88%。此外,研究人员利用Eigen-CAM提供监督YOLO检测器的视觉解释,提高了目标检测结果的可解释性。检测系统采用专门设计的移动摄像头作为主要视觉输入源,并与6-DoF Hiwonder xArm 1S机械臂耦合,通过动态目标拾取和基于逆运动学(Inverse Kinematics)的机器人运动控制实现蔬菜的自主拾放分拣。在该机器人架构中,总共使用了9个箱子用于放置分拣后的蔬菜,机器人被设计成能够通过机械臂的中心位置到达目标箱子以放置所选蔬菜。因此,通过ByteTrack跟踪验证过程,成功执行该分拣过程的成功率估计为89.6%。研究人员设计了一个基于OpenCV的交互式监控仪表板,用于监控检测、跟踪、机器人运动以及整个系统的状态。实验表明,自监督预训练显著提高了检测和定位精度,并减少了对标注的依赖。
**论文解读:基于自监督视觉引导的机器人采后蔬菜新鲜度智能分拣系统**
在现代化农业和食品加工快速变化的背景下,蔬菜分拣仍然是劳动密集型且易出错的操作,经常导致效率低下、运营成本增加,以及因质量评估波动造成的重大食物损失。蔬菜作为易腐食品,必须及时且无误地根据新鲜度进行分拣,以维护供应链完整性、确保消费者安全,并防止全球每年数十亿美元的经济损失。人工智能(AI)和机器人技术的结合提供了一种突破性的解决方案,即实时自动化分拣技术,该技术能够高精度识别腐烂或变质等缺陷,从而提高生产力、减少人为错误,并在面临人口增长和气候不确定性压力的行业中维护环境友好型实践。尽管已有研究在农作物检测、收获辅助、成熟度评估和货架期预测等方面取得了有前景的结果,但大多数现有方法将这些任务独立处理,而非作为集成智能分拣系统。此外,许多方法仍严重依赖大规模标注数据集,在光照变化和遮挡条件下鲁棒性不足,且模型可解释性有限。将自监督表示学习、可解释人工智能、实时目标跟踪和机器人操作整合到一个统一的采后蔬菜新鲜度分拣框架中,仍是一个尚未充分探索的领域。因此,研究人员开展了这项研究,旨在开发一个端到端的解决方案。
研究人员提出了一种端到端的机器人框架,结合监督学习和自监督学习、可解释AI以及机器人操作,用于视觉引导的自动蔬菜新鲜度分拣。通过平衡的蔬菜数据集和5折交叉验证,选择YOLOv12s作为最可靠的监督学习算法,而DINOv2风格的自监督预训练进一步提升了特征提取、聚类和定位鲁棒性。利用Eigen-CAM的可解释性使模型更加透明,能够识别新鲜度识别的有意义信息。感知框架有效部署在基于逆运动学拾放技术的Hiwonder xArm 1S 6-DOF机器人操作器上,并配备OpenCV监控仪表板。实验结果表明,该框架在可靠检测和自主分拣任务方面具有有效性。该论文发表在《Smart Agricultural Technology》。
研究人员构建了一个包含4,640张图像、涵盖8种蔬菜类型(黄瓜、番茄、苦瓜、尖椒、土豆、洋葱、茄子、柠檬)且每类包含新鲜和损坏子类别的平衡数据集,数据来源于多款安卓手机。采用三种监督YOLO模型(YOLOv10s、YOLOv11s、YOLOv12s)进行基准比较,并通过5折交叉验证评估。随后,应用三种自监督学习(SSL)预训练方法——DINOv2风格、BYOL(Bootstrap Your Own Latent)和MAE(Masked Autoencoder)——以提升特征表示。系统集成方面,利用基于ArUco标记的平面同形映射(Homography)进行相机-机器人坐标校准,采用ByteTrack进行目标跟踪,并通过逆运动学(IK)实现机械臂控制。最后,基于OpenCV开发了实时监控仪表板,并集成Eigen-CAM(一种基于PCA的梯度型可解释性方法)进行可视化解释。
**4.3 监督模型损失曲线s训练收敛稳定,损失逐步下降,mAP在约20个epoch后超过0.98;YOLOv11s学习曲线更平滑,早期泛化能力更强;YOLOv10s初始损失较高,但最终mAP接近0.98。
**4.5 SSL架构聚类分析**:通过PCA和t-SNE可视化特征空间。DINOv2风格生成紧凑且分离度高的聚类;BYOL特征分布较分散,类间重叠较多;MAE特征聚类更紧密,类内混淆较少。
**4.6 SSL架构检测可视化**:定性分析显示,DINOv2风格定位精确,边界框贴合度高;BYOL分类正确但定位稍差;MAE预测一致且误差小。
**4.7 混淆矩阵分析**:DINOv2风格+YOLOv12s在特征分离上表现优异,多数类正确分类,错误主要发生在视觉相似的新鲜/损坏子类之间;MAE+YOLOv12s对角线优势最强,分类准确率最高;BYOL存在一定类间混淆。
**4.8 可解释AI技术**:Eigen-CAM热图显示模型主要关注蔬菜区域(包括新鲜和损坏部分),背景激活极少,表明模型基于有意义的视觉特征做出决策,增强了可解释性和信任度。
**4.9 机械臂性能**:在5分钟评估期内,系统执行48次拾取循环,成功43次,总体成功率为89.6%。不同类别成功率存在差异,如黄瓜新鲜、柠檬新鲜、尖椒新鲜和土豆新鲜均为100%,而番茄新鲜成功率为71.4%,苦瓜新鲜为80.0%。检测稳定性为87.5%,跟踪丢失率仅6.25%。轨迹验证显示平均轨迹长度58.3像素,远高于15像素的验证阈值,有效轨迹比例为91.2%。平均每次拾取能耗约35.7 J。
**4.10 实时Web应用仪表板**:基于OpenCV的仪表板集成了自动化控制面板、实时检测模块、绘图可视化模块、手动分类拾放模块和手动舵机控制面板,实现了统一监控与操作。
**讨论总结**:研究结果表明,所提出的框架在新鲜和损坏蔬菜的检测与分类方面高效。YOLOv12s在精确率和召回率上表现平衡,mAP50达99.01±0.27%,mAP50-95为82.29±0.52%,展示了高空间一致性和稳定性。自监督学习,特别是DINOv2风格预训练,显著提升了特征表示,使YOLOv12s的mAP50达到98.83%,mAP50-95为82.88%。聚类分析支持了这些结论,DINOv2生成的高分离度紧凑聚类优于BYOL和MAE。可解释性分析表明模型关注表面缺陷、变色和纹理差异等关键区域。系统在多种蔬菜类别上实现了高效实时处理,总体分拣成功率为89.6%。失败案例主要归因于光照变化导致的偶发误检、嵌入式平台计算能力限制以及缺乏力/触觉传感器。与现有文献相比,该框架在检测精度、特征表示和系统集成方面具有优势,但存在局限性,如数据采集条件较理想、视觉相似蔬菜分类困难、数据集多样性有限、机器人验证过程依赖计算资源等。未来工作将聚焦于真实环境测试、数据扩充、多传感器融合和边缘计算部署。
**翻译研究结论部分**:本文提出了一种端到端的机器人框架,结合监督学习和自监督学习、可解释人工智能以及机器人操作,用于视觉引导的自动蔬菜新鲜度分拣。基于平衡的蔬菜数据集和5折交叉验证的结果,选择YOLOv12s作为最可靠的监督xc体育学习算法,而类似DINOv2风格的预训练方法进一步提升了特征提取、聚类和定位鲁棒性。通过使用基于Eigen-CAM的可解释性,模型通过识别用于新鲜度识别的有意义信息变得更加透明。另一方面,感知框架基于逆运动学拾放技术和OpenCV监控仪表板,有效部署在Hiwonder xArm 1S 6自由度机器人操作器上。实验结果表明了所提出框架在可靠检测和自主分拣任务方面的有效性。然而,在低光照环境、视觉相似的新鲜度类别以及可扩展性方面仍存在一些局限性。