农业大模型是推动智慧农业发展和农业现代化的重要技术支撑。然而,农业数据普遍存在高质量标注数据不足、样本分布不均衡以及新类别持续出现等问题,制约了农业大模型的知识获取能力和场景泛化能力。围绕农业大模型研发中的数据稀缺与知识获取难题,西北农林科技大学信息工程学院刘斌教授团队及骨干成员郭鹏程博士长期开展农业大模型研究,形成了一系列具有代表性的人工智能算法成果,为学校联合华为技术有限公司发布的“九壤耘星”农业垂直领域大模型建设与智能化升级提供了重要技术支撑。

图1刘斌教授数字农业分会年会中分享报告九壤耘星农业大模型
针对农业生产中病害种类繁多、新发病害难以提前覆盖的问题,团队提出去偏广义类别发现方法,突破传统方法对固定类别空间的依赖,使模型能够从开放环境数据中发现潜在新类别,为农业大模型识别未知病害、适应新发病害提供了新的技术路径。


图2. 广义类别发现研究框架
针对农业病害图像标注成本高、大量田间数据难以充分利用的问题,团队提出基于伪标签偏差校正的半监督学习方法,通过提升未标注数据利用效率和模型学习能力,有效降低农业视觉模型对大规模人工标注数据的依赖,为农业大模型持续学习海量农业图像数据提供算法支撑。

图3. 广义协同细化估计研究框架
针对农业领域大量病虫害防治手册、农技资料和图文混排文档的智能处理需求,团队提出DCMAI动态跨模态对齐交互框架,增强文本与图像之间的语义关联和联合理解能力,为农业专业知识抽取、知识库构建和智能问答提供技术基础。

图4. 跨模态文档智能分析系统
此外,团队进一步提出类缺失半监督文档关键信息提取方法,针对类别信息不完整、真实数据条件受限等问题,通过协同细化估计机制提升关键信息提取能力,为农业植保知识结构化和专业知识持续积累提供了有效方法。

图5. 半监督文档智能系统
近年来,刘斌教授团队在人工智能与数据挖掘领域持续开展科研攻关,已在AAAI、CVPR、IJCAI、IEEE Transactions on Knowledge and Data Engineering、IEEE Transactions on Circuits and Systems for Video Technology、Information Processing & Management、ICASSP、IJCNN、Neurocomputing等国际重要会议和期刊发表相关论文11篇,形成了较为系统的研究积累。上述系列成果已深度支撑“九壤耘星”农业大模型建设。该模型由西北农林科技大学联合华为技术有限公司发布,依托国产人工智能算力基础设施,融合华为昇腾AI云服务与ModelArts平台。团队相关研究为模型的病害识别、未知类别发现、农业知识抽取和智能问答等核心能力提供了关键算法支撑,进一步提升了农业大模型的专业化与智能化水平。
刘斌教授团队始终面向国家智慧农业发展需求,持续推动人工智能基础研究与农业实际场景深度融合。面向未来,团队将进一步围绕农业人工智能和农业大模型关键技术开展研究,促进人工智能方法、农业专业知识、国产算力平台与真实生产场景协同创新,为“九壤耘星”农业大模型持续迭代升级、农业人工智能学科建设和智慧农业发展贡献西农力量。(王婕 汪嘉钰)
(来源:中国农科新闻)