山西大学研发的聚焦形貌重建大模型相关成果在人工智能顶尖期刊刊发

2026-09-23 08:13:06
来源:未来网

近日,山西大学人工智能学院、大数据科学与产业研究院演化数据智能团队研发的聚焦形貌重建大模型相关成果以“Focus Depth Anything: Towards Robust Depth from Focus in the Wild”为题,在国际人工智能顶级期刊International Journal of Computer Vision发表(简称IJCV,影响因子10.3)。论文第一作者为山西大学2023级博士研究生张江峰,通讯作者为钱宇华教授,合作者为闫涛教授、博士研究生胡深、张亚宇讲师和博士研究生刘晋文。

该研究针对聚焦图像序列的三维形貌重建在开放场景中泛化能力不足的关键难题,首次提出聚焦形貌重建大模型Focus Depth Anything(FDA)。不同于现有方法直接从离散聚焦响应预测深度,FDA创新性地将大模型的几何先验与聚焦成像的物理信息相结合,通过全局深度先验对场景结构进行约束,并利用聚焦信息进行局部修正,有效缓解离散聚焦采样带来的深度歧义。这一机制显著提升了模型在未知场景中的泛化能力,推动了聚焦形貌重建从特定场景建模走向开放世界通用三维感知。这是国内Depth from Focus(DfF)领域研究首次登上IJCV期刊。

三维形貌重建作为精密制造中质量控制和工艺优化的关键技术,在激光制版、集成电路等精密制造领域具有重要应用价值。然而,面向开放场景的聚焦形貌重建仍面临三大挑战:(1)离散聚焦采样导致深度求解存在歧义;(2)现有深度学习方法依赖数据集的场景语义,开放场景泛化能力不足;(3)现有视觉大模型在微观等弱语义场景中深度预测易失效。针对上述挑战,本研究首次提出面向聚焦形貌重建的大模型FDA,取得以下创新性突破:

(1)范式创新:提出后验修正的聚焦形貌重建框架,以大模型几何先验约束全局结构,并利用聚焦信息进行局部修正,有效缓解离散聚焦采样带来的深度歧义;

(2)方法创新:提出语义聚焦解耦模块,通过差分机制增强模型在多聚焦图像序列的表征能力,实现大模型几何先验与聚焦物理信息的有效融合;

(3)数据创新:构建基于点扩散函数的可扩展数据引擎,低成本生成大规模的聚焦图像序列,为聚焦形貌重建大模型的训练与泛化提供数据支撑。

论文在多个宏/微观场景中进行了验证,结果表明FDA在重建精度和跨场景泛化方面均表现出显著优势,并在激光制版的体积估计等精密制造场景中展现出良好的应用潜力。

该研究工作得到国家自然科学基金重大项目(T2495250, T2495251)、国家自然科学基金(62472268, 62506219),中央引导地方科技发展资金项目(YDZJSX20231C001, YDZJSX20231B001, YDZJSX2024D011)等支持。

IJCV期刊是国际上公认的人工智能领域顶级期刊,同时也被中国计算机学会(CCF)推荐为人工智能领域的A类期刊,主要刊登人工智能领域的高质量前沿研究成果。(通讯员:张颖)

  编辑:高富灿