中国人工智能学会模式识别专家讲坛“多模态视觉感知与生成”将在武汉大学举办
发布时间:2026年07月20日      来源:https://mp.weixin.qq.com/s/E8F8QAI0hWCxTwmK8jOS1Q

2026 年7月25日,由中国人工智能学会(CAAI)主办,CAAI模式识别专委会承办的中国人工智能学会模式识别专家讲坛“多模态视觉感知与生成”将在武汉大学举办。

一、 背景及介绍

随着多模态、大模型、具身智能等前沿技术的快速发展,计算机视觉迎来了更具前景的发展机遇。

本次专家讲坛以“多模态视觉感知与生成”为主题,围绕视觉信号语义内容表达、类人视觉感知、具身智能多模态感知、自主决策等方向,邀请视觉计算、具身智能、机器人学习、智能感知等领域专家学者作特邀报告。

论坛将聚焦多模态视觉感知与生成在复杂真实场景中的关键问题,探讨视觉感知如何支撑智能体理解物理世界、如何从类人视觉感知走向机器人具身智能、如何提升多模态感知与自主决策能力,以及混合AI架构等前沿技术的发展趋势与应用前景。

诚邀相关领域师生、科研人员、产业界代表参会交流,共同探讨多模态视觉感知与生成技术在视觉计算、具身智能方向的创新发展。

二、 组委会成员

王   密教授,武汉大学,测绘遥感信息工程全国重点实验室副主任

杜   博 教授,武汉大学,发展规划与学科建设办公室主任

王   骞 教授,武汉大学,国家网络安全学院院长

何德彪 教授,武汉大学,计算机学院院长

夏桂松 教授,武汉大学,人工智能学院执行院长

涂志刚 教授,武汉大学,测绘遥感信息工程全国重点实验室

三、 日程安排

报告时间:2026 年7月25日(周六)下午14:00 至17:50

地 点:武汉大学信息学部·星湖实验大楼305报告厅

图片

四、报告专家

Junsong Yuan Director, University at Buffalo, State University of New York

刘家瑛 教授,北京大学

鲁继文 教授,清华大学

山世光 研究员,中国科学院计算所

史振威 教授,北京航空航天大学

阮   翔 教授,大连理工大学

白   翔 教授,华中科技大学

刘新旺 教授,国防科技大学

图片

刘家瑛

北京大学博雅特聘教授

王选计算机研究所副所长

电子出版新技术国家工程研究中心副主任

教育部“长江学者奖励计划”特聘教授

IEEE Fellow

个人简介:研究领域为智能媒体计算,发表IEEE/ACM汇刊与CCF A类论文200余篇,谷歌学术引用近3万余。担任IEEE Trans. on Image Processing,IEEE Trans. on Circuit Systems for Video Technology,IEEE Multimedia Magazine等期刊编委,IEEE ICME/ACM ICMR指导委员会委员,ACM MM Asia 2024大会主席,ACM MM Asia 2025/2023,ACM ICMR 2021/IEEE ICME 2021大会程序主席,CVPR/ICCV/ECCV/ACM MM会议领域主席等。高校计算机专业优秀教师奖励计划获得者,获省部级奖励三项、CSIG石青云青年女科学家奖、北京大学教学卓越奖、王选青年学者等。主讲的全球MOOC课程获教育部首批国家精品在线开放课程,教育部首批国家级一流本科课程。

报告题目:生成图像之美

报告摘要:本次报告以“生成图像之美”为主题,系统介绍生成式人工智能技术在多个视觉艺术创作领域的前沿探索。在艺术文字生成方面,针对特色字效数据稀缺的挑战,提出基于统计分析与特征解耦的生成方法,实现高质量艺术字效的迁移与创新设计,展现汉字在智能创作中的结构之美与风格之美。在花纹与藻井设计方面,通过在扩散模型中引入复杂的空间结构约束,解决高分辨率周期性图案的生成难题,并展望智能技术在传统纹样创新设计中的美学潜力,呈现生成模型所赋予的装饰之美与文化延续。在历史影像修复方面,依托大模型条件生成技术实现退化影像的结构补全与语义演绎,在恪守史实真实性的前提下唤醒尘封的历史记忆,以数字技术复刻时代风貌,诠释历史遗存独有的纪实之美与传承之美。

图片

鲁继文

清华大学长聘教授、自动化系副主任

国家杰出青年科学基金获得者

IEEE/IAPR Fellow

个人简介:主要研究方向包括机器视觉感知、具身智能系统、人工智能安全,发表IEEE T-PAMI论文50余篇,获授权国家发明专利60余项,主持国家重点研发计划项目1项、国家自然科学基金重点项目3项,以第一完成人获中国电子学会自然科学一等奖1项、技术发明一等奖1项,吴文俊人工智能自然科学一等奖1项,作为主要完成人获国家科技进步二等奖1项、国家级教学成果奖二等奖1项。担任通用世界模型北京市重点实验室学术委员会主任,具身智能系统北京市重点实验室副主任,国际期刊NPJ Computer Vision、Pattern Recognition Letters主编,中国图像图形学会理事,中国仿真学会理事。

报告题目:通用具身智能大脑

报告摘要:具身智能是人工智能与机器人的研究热点,在现代服务、医疗康养、深海探测等领域有着重要的应用前景。报告将首先回顾具身智能的发展历程,然后重点介绍近年来通用具身智能大脑的主要进展,包括跨任务空间感知大脑、跨本体灵巧操作大脑、跨场景安全评测大脑等基础方法与关键技术,并介绍通用具身智能大脑的典型应用案例,最后对未来发展趋势进行预测与展望。

图片

山世光

中国科学院计算技术研究所研究员

智能算法安全全国重点实验室副主任

智能信息处理实验室主任

国家级领军人才

IEEE Fellow

个人简介:国务院特殊津贴专家,首届腾讯科学探索奖获得者,CCF青年科学家奖获得者。研究领域为人工智能,特别是计算机视觉、模式识别、深度学习、情感计算、AI安全、具身智能等。研究成果获2005年度国家科技进步二等奖,2015年度国家自然科学二等奖,2022年度CSIG自然科学一等奖,2024年度CSIG自然科学一等奖。现/曾任CCF青工委副主任,CAAI模式识别专委会副主任,CAAI情感计算专委会副主任等。

报告题目:如何为人脸识别构造一个纯虚拟的图像集合?

报告摘要:构建可供模型训练的纯虚拟人脸数据集是解决人脸感知和理解领域面临的日益严重的隐私与偏见问题的潜在路径之一。尽管基于扩散模型的人脸生成技术已取得长足发展,但基于生成数据训练的人脸识别模型精度仍不及使用真实图像训练的模型。这一性能差距源于合成人脸风格多样性不足、同一身份内的人脸变化匮乏等问题。为生成更逼真的虚拟人脸,我们提出一种文本引导的富变化人脸生成方法TextFace,该方法一方面采用组合式文本控制提升整体图像风格丰富度,另一方面设计规范化的分空间身份融合策略,扩充同一身份内人脸变化。大量实验证明,使用TextFace纯合成数据训练的人脸识别模型性能全面超越现有身份保持人脸生成方案,显著缩小了与真实数据训练效果之间的差距。

图片

史振威

北京航空航天大学二级教授

国家杰出青年科学基金获得者

国家级创新团队负责人

个人简介:北航校学术委员会委员,宽域飞行智能控制与信息处理学科方向负责人,飞行器控制与信息工程本科专业负责人。主要从事遥感图像处理、遥感大模型和时空智能方面的研究,发表科研论文300余篇(其中IEEE Trans期刊论文100余篇),论文引用28000余次。获2025年度国际地球科学与遥感协会最高影响力论文奖。担任学术期刊《IEEE Transactions on Geoscience and Remote Sensing》、《Pattern Recognition》和《Infrared Physics & Technology》编委;担任中文核心期刊《中国空间科学技术》副主编、《中国图象图形学报》和《数据采集与处理》等编委。现任中国图像图形学会监事。

报告题目:多模态遥感大模型研究进展

报告摘要:多模态遥感大模型是当今航天遥感技术与人工智能基础前沿的深度融合,是国家重大需求引领下的未来科技战略制胜的必争高地。在本次报告中,将对近年来课题组在多模态遥感大模型方面的研究工作及相关应用案例进行介绍,具体包括遥感图像生成式大模型、遥感视觉语言多模态大模型、遥感多模态解译智能体等;最后,对航天遥感大模型方向未来研究方向以及潜在的应用进行展望。

图片

阮翔

大连理工大学教授

国家级高层次人才

入选“兴辽英才计划”

个人简介:主要研究方向为计算机视觉、视觉注意机制与多模态学习。从事计算机视觉研发逾25年,曾任欧姆龙集团算法专家并荣获集团最优秀专利奖。他是世界首个嵌入式相机美颜技术的发明人,并作为主要贡献者构建了国际知名的视觉显著性数据集DUT-OMRON。在 CVPR、ICCV、IEEE TPAMI 等国际顶级学术会议和期刊上发表多篇高水平学术论文。近期的研究兴趣聚焦于医疗相关的多模态感知、具身智能与分散式学习等领域。

报告题目:意图驱动显著性检测(Intent-driven Saliency)——重访显著性检测的一些思考

报告摘要:显著性检测(Saliency Detection)作为计算机视觉的基础性任务,旨在模拟人类视觉系统快速定位场景中重要信息的能力。在本次报告中,将回顾这一领域的演进历程,并分享近期重新审视该问题的一些思考。

首先,报告将追溯当初进入该领域的初衷,重温早期在探索经典计算模型和构建基础数据平台时的核心考量与面临的挑战。随后,报告将梳理二十余年来显著性检测的发展脉络:从早期基于底层视觉特征的“刺激驱动”启发式模型,到近十年来深度学习浪潮下数据驱动范式的兴起与繁荣,以及该领域近期的技术演进与趋势。

近年来,随着主流模型在标准评测上的性能逐渐逼近天花板,传统的显著性检测研究出现了一定程度的“降温”。然而,真实开放场景中人类的视觉注意并非单纯的被动响应,而是受瞬时任务意图、环境情境与先验知识强烈调控的主动过程。针对现有模型“千人一面”和缺乏高级认知理解的局限性,我希望借此次报告“重访”这一经典题目。
报告的最后将探讨关于“意图驱动显著性检测(Intent-driven Saliency)”的一些初步构想。通过探索如何将用户的动态意图、情境感知与视觉特征相融合,不仅为显著性检测寻找新的突破口,更期望以此为契机,启发我们在未来更广泛的视觉任务中引入“用户意图感知”,推动视觉计算从被动的感知智能向主动的认知智能迈进。

图片

白翔

华中科技大学软件学院院长、教授

国家杰出青年基金获得者

IEEE/IAPR Fellow

个人简介:长期从事人工智能、计算机视觉与模式识别研究,兼任机器视觉与智能系统湖北省工程研究中心主任、Pattern Recognition副主编(A-EIC),曾任CVPR、ICCV、AAAI、IJCAI等国际顶级会议领域主席及ICDAR 2025大会主席。在Nature Machine Intelligence、IEEE TPAMI、CVPR等国际期刊和会议发表论文200余篇,谷歌学术引用6万余次,H指数113,连续入选Elsevier中国高被引学者。曾获CCF A类会议最佳论文奖、IAPR/ICDAR青年学者奖等多项荣誉。

报告题目:MonkeyOCR非结构化文档数据治理与应用

报告摘要:随着大模型技术快速发展,文档数据作为重要的信息载体,其高效解析、精准抽取与有序治理已成为大模型训练的核心数据来源,也是千行百业智能化应用落地的重要基础。本报告围绕多源异构文档数据治理与应用展开,重点介绍MonkeyOCR系列非结构化文档解析技术的最新进展,并结合实际应用场景,展望多源异构文档数据治理未来向智能化演进的方向。

图片

刘新旺

国防科技大学计算机学院教授

国家杰出青年基金获得者

个人简介:主要研究方向为机器学习、数据挖掘等。国家杰青(2023)、国家优青(2019)获得者。国家自然科学基金委重点项目、科技创新2030重大项目负责人,基金委创新群体A类核心成员。共发表CCF A类期刊/会议论文150余篇, ESI高被引论文20篇, 谷歌学术引用共2.7万余次, 连续4年入选全球2%顶尖科学奖榜单 (2022-2025)。担任IEEE T-KDE, IEEE T-NNLS, IEEE T-CYB等国际顶刊AE, 以及ICML, NeurIPS等国际顶会领域主席。研究成果获中国计算机学会自然科学一等奖(2025)、中国人工智能学会吴文俊自然科学一等奖(2024)、北京市科技进步一等奖(2024)、湖南省自然科学一等奖 (2014, 2021)、中国图象图形学会自然科学二等奖 (2024, 2025)等。

报告题目:SimpleMKKM: Simple Multiple Kernel K-means

报告摘要:本次报告将介绍本课题组最近提出的SimpleMKKM融合聚类框架及其相关拓展。首先,区别于常用的min-min/max-max聚类算法,我们提出一个全新的min-max模型,并设计出新的求解算法,保证所得到的解具有全局最优性;该模型在不同应用中展示了优越的聚类性能,且不含任何超参数。在此基础上,我们采用核矩阵局部对齐的思想对其进行拓展,提出一种局部化SimpleMKKM算法。此外,我们进一步提出一种无参的样本自适应局部化SimpleMKKM算法。

本文由CAAI模式识别专委会供稿

你知道你的Internet Explorer是过时了吗?

为了得到我们网站最好的体验效果,我们建议您升级到最新版本的Internet Explorer或选择另一个web浏览器.一个列表最流行的web浏览器在下面可以找到.