
姓名:毛琪
职称 / 硕(博)导:教授 / 硕导
学硕招生专业 / 方向:信息与通信工程 / 智能视频处理
专硕招生专业 / 方向:人工智能 / 智能视听技术
主要研究领域:AIGC,视频生成编辑,智能体, 智能图像视频编码
电子邮箱Email:qimao@cuc.edu.cn
个人简介
中国传媒大学教授,博士毕业于北京大学高文院士马思伟教授(国家杰青)团队,加州大学默塞德分校联合培养博士,师从Prof.Ming-Hsuan Yang (IEEE/ACM Fellow),新加坡国立大学Show-Lab访问学者(合作导师:Mike Z. SHOU),主要研究方向为智能媒体内容的生成与编码。获得2023年北京市图象图形学学会优秀博士论文奖,2023年全国广播电视和网络视听行业青年创新人才,2024年微软亚洲研究院铸星学者,2026年北京图象图形学学会最美女科技工作者,2026年北京市高创计划青年人才托举工程等,主持国家自然科学青年基金项目、面上项目、作为骨干成员参与国家重点研发计划等。近年来发表包括IJCV、TIP、TMM、TCSVT、TAFFC、SIGCOMM、CVPR、ACM MM、ECCV等顶级国际期刊会议论文四十余篇,谷歌学术引用量超3500;授权国家发明专利10项,接收AVS技术提案多项。担任计算机视觉和机器学习顶会CVPR、ICCV、ECCV、WACV、ICML、ICLR等领域主席;2025 ACM MM Asia Poster&Demo联合主席;中国图像图形学会多媒体专委会/女工委委员;北京图象图形学学会青工委委员;IEEE CASS MSA TC Member。
招生信息
长期欢迎计算机基础扎实、编程能力强,对科学研究有浓厚兴趣,勇于挑战、认真负责的同学加入团队攻读研究生。同时,也非常欢迎优秀本科生加入我们提前参与科研实践。
联系邮箱:cuc_mipg@163.com
邮件内容:个人简历+成绩证明+代表性成果(论文、项目、代码、作品或竞赛经历均可)
邮件主题:姓名-学校-专业-20xx推免咨询/本科招新
实验室公众号:智能多媒体处理小组
实验室小红书:CUC-MIPG
实验室网页:https://cuc-mipg.github.io
承担的主要科研项目
[1] 国家自然科学基金面上项目,62471445,基于离散特征表示与生成式模型的极限编码理论与方法研究,在研,主持。
[2] 国家重点研发计划,2022YFF0902402,沉浸式文旅体验技术集成与场景创新,结题,骨干成员。
[3] 国家自然科学青年基金项目,62201526,基于分层特征表示的人-机协同视频编码研究,结题,主持。
[4] 多媒体信息处理全国重点实验室开放课题,SKLMIP-KF-2025-04,融合时空语义控制的文本驱动扩散视频编辑方法,结题,主持。
[5] 百度NLP学术合作,HG23056,结题,主持。
[6] 中国传媒大学校级科研创新团队,CUC26TD07,认知引导的可控内容生成,在研,主持。
[7] 中国传媒大学“三国”专项项目,CUC25SG008,高流行度短视频特征解析及生成技术研究,结题,主持。
[8] 中国传媒大学“三国”专项项目,CUC24SG015,基于情感引导的智能媒体内容可控生成,结题,主持。
[9] 媒体融合与传播国家重点实验室专项科研项目,CUC23GZ007,基于 AIGC 的对话多媒体内容生成,结题,主持。
[10] 媒体融合与传播国家重点实验室专项科研项目,CUC22GZ035,深度学习人脸生成与鉴伪方法研究,音视频鉴伪系统,结题,主持。
代表性学术成果
期刊论文:
[1] Yuanhang Li, Qi Mao(*), Xinyan Xiao, Libiao Jin, and Siwei Ma. HD-Custom: Efficient Hierarchical Disentanglement for Coarse-to-Fine Concept Customization in Subject Video Generation. IEEE Transactions on Circuits and Systems for Video Technology (2026).(CCF-B)
[2] Qi Mao(*) , Haobo Hu, Yujie He, Difei Gao, Haokun Chen, and Libiao Jin. EmoAgent: A Multi-Agent Framework for Diverse Affective Image Manipulation. IEEE Transactions on Affective Computing (2026).(CCF-B)
[3] Junlong Gao, Zhimeng Huang, Qi Mao(*), Siwei Ma, and Chuanmin Jia. Exploring Multimodal Knowledge for Image Compression via Large Foundation Models. IEEE Transactions on Image Processing (2025).(CCF-A)
[4] Yuanhang Li, Qi Mao(*), Lan Chen, Zhen Fang, Lei Tian, Xinyan Xiao, Libiao Jin, and Hua Wu. StarVid: Enhancing Semantic Alignment in Video Diffusion Models via Spatial and Syntactic Guided Attention Refocusing. IEEE Transactions on Multimedia (2025).(CCF-A)
[5] Jianhui Chang, Jian Zhang, Jiguo Li, Shiqi Wang, Qi Mao, Chuanmin Jia, Siwei Ma, and Wen Gao. Semantic-Aware Visual Decomposition for Image Coding. International Journal of Computer Vision (2023).(CCF-A)
[6] Qi Mao, Chongyu Wang, Meng Wang, Shiqi Wang, Ruijie Chen, Libiao Jin, and Siwei Ma. Scalable Face Image Coding via StyleGAN Prior: Towards Compression for Human-Machine Collaborative Vision. IEEE Transactions on Image Processing (2023).(CCF-A)
[7] Qi Mao(*), Siwei Ma. Enhancing Style-Guided Image-to-Image Translation via Self-Supervised Metric Learning. IEEE Transactions on Multimedia (2023).(CCF-A)
[8] Jianhui Chang, Zhenghui Zhao, Chuanmin Jia, Shiqi Wang, Lingbo Yang, Qi Mao, Jian Zhang, and Siwei Ma. Conceptual Compression via Deep Structure and Texture Synthesis. IEEE Transactions on Image Processing (2022).(CCF-A)
[9] Qi Mao, Hung-Yu Tseng, Hsin-Ying Lee, Jia-Bin Huang, Siwei Ma, and Ming-Hsuan Yang. Continuous and Diverse Image-to-Image Translation via Signed Attribute Vectors. International Journal of Computer Vision (2022).(CCF-A)
[10] Hsin-Ying Lee, Hung-Yu Tseng, Qi Mao(共同第一作者), Jia-Bin Huang, Yu-Ding Lu, Maneesh Singh, and Ming-Hsuan Yang. DRIT++: Diverse Image-to-Image Translation via Disentangled Representations. International Journal of Computer Vision. International Journal of Computer Vision (2020).(CCF-A,ESI高被引论文)
会议论文:
[1] Haobo Hu, Xiangwu Guo, Zhiheng Chen, Difei Gao, Haotian Liu, Libiao Jin, and Qi Mao(*). CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing. Proceedings of the 34th ACM International Conference on Multimedia (2026).(CCF-A)
[2] Ze Chen, Lan Chen, Yuanhang Li, and Qi Mao(*). FlowAnchor: Stabilizing the Editing Signal for Inversion-Free Video Editing. Proceedings of the 34th ACM International Conference on Multimedia (2026).(CCF-A)
[3] Qi Mao(*), Hao Cheng, Tinghan Yang, Libiao Jin, and Siwei Ma. Generative Neural Video Compression via Video Diffusion Prior. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2026).(CCF-A)
[4] Lan Chen, Yuchao Gu, Qi Mao(*). UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models. Proceedings of Winter Conference on Applications of Computer Vision (2025).
[5] Ruijie Chen, Qi Mao(*), Zhengxue Cheng. Stable Diffusion is a Natural Cross-Modal Decoder for Layered AI-generated Image Compression. Proceedings of Data Compression Conference (2025). (CCF-B,数据压缩领域顶级会议)
[6] Qi Mao(*), Lan Chen, Yuchao Gu, Zhen Fang, and Mike Zheng Shou. MAG-Edit: Localized Image Editing in Complex Scenarios via Mask-Based Attention-Adjusted Guidance. Proceedings of the 32nd ACM International Conference on Multimedia (2024).(CCF-A)
[7] Naifu Xue, Qi Mao(*), Zijian Wang, Yuan Zhang, and Siwei Ma. Unifying Generation and Compression: Ultra-Low-Bitrate Image Coding via Multi-Stage Transformer. Proceedings of IEEE International Conference on Multimedia and Expo (2024).(CCF-B)
[8] Qi Mao(*), Tinghan Yang, Yinuo Zhang, Zijian Wang, Meng Wang, Shiqi Wang, Libiao Jin, and Siwei Ma. Extreme Image Compression Using Fine-Tuned VQGANs. Proceedings of Data Compression Conference. Data Compression Conference (2024).(CCF-B,数据压缩领域顶级会议)
[9] Lingyu Zhu, Wenhan Yang, Baoliang Chen, Hanwei Zhu, Zhangkai Ni, Qi Mao, and Shiqi Wang. Unrolled Decomposed Unpaired Learning for Controllable Low-Light Video Enhancement. Proceedings of European Conference on Computer Vision (2024).(CCF-B,计算机视觉领域顶级会议)
[10] Jiangkai Wu, Yu Guan, Qi Mao, Yong Cui, Zongming Guo, and Xinggong Zhang. ZGaming: Zero-Latency 3D Cloud Gaming by Image Prediction. Proceedings of ACM SIGCOMM (2023).(CCF-A,计算机网络传输领域顶级会议)
[11] Qi Mao, Hsin-Ying Lee, Hung-Yu Tseng, Siwei Ma, and Ming-Hsuan Yang. Mode-Seeking Generative Adversarial Networks for Diverse Image Synthesis. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2019).(CCF-A)
专利:
[1] 毛琪等,基于多智能体协作框架的情感图像编辑方法及系统,ZL 202510265095.8。
[2] 毛琪等,基于文生图大模型的图像编辑方法及系统,ZL 202510412838.X。
[3] 毛琪等,基于大规模文生视频模型的视频生成方法及系统,ZL 202410948632.4。
[4] 毛琪等,生成—熵估计联合的极限图像压缩、解压缩方法及系统。ZL 202410251403.7。
[5] 毛琪等,基于矢量量化索引和生成模型的极限图像压缩方法及系统,ZL 202310778269.1。
[6] 毛琪等,面向人机混合视觉的可伸缩人脸图像编码方法、系统,ZL 202310140101.8。
[7] 毛琪等,基于生成模型的人体视频压缩方法、系统,ZL 202210445390.8。

