
扫码添加

添加学术顾问微信
免费获取服务方案
随着视觉语言模型(VLM)的快速发展,以CLIP为代表的大规模跨模态模型已展现出强大的视觉理解能力。然而,年龄估计、疾病分级、美学评分等视觉评分任务属于序数回归(Ordinal Regression),标签之间具有天然的连续性与等级关系。
传统方法将不同等级视为彼此独立的类别,导致模型难以真正理解"顺序"和"距离"背后的语义含义。本课题利用语言模型中天然蕴含的人类知识与顺序语义,将"年龄""病变程度""图像质量"等等级概念映射到统一的语言语义空间中,帮助模型建立更加连续、稳定且具有可解释性的表征。
关键词: MLLM、VLM、CLIP、语义对齐、Few-shot Learning、序数回归
| 创新点 | 目标区位 | 目标期刊 |
|---|---|---|
| 构建"正样本—邻近样本—远距样本"的序数对比学习框架 | CCF-A、CCF-B、SCI 1–2区 | ICCV、ECCV、IJCV、Neural Networks、KBS |
| 构建面向视觉评分任务的多模态大模型 | CCF-A、CCF-B、SCI 1区 | IJCAI、NeurIPS、ESWA、KBS |
| Concept-CLIP:不止学习标签,还要学习概念 | CCF-B、SCI 2区 | MICCAI、Neurocomputing、Neural Networks |
Tong老师,Top50高校计算机博士,从事医学图像计算、计算机视觉及多模态大模型应用的前沿研究。
多次在医学图像分析、人工智能、计算机视觉等领域的顶级国际会议发表高水平论文
主要研究方向:医学图像分割与疾病分级、多模态大模型指令微调、水质预测与知识蒸馏
指导过多名本科生及低年级研究生参与科研项目,多名学生在顶级会议及高水平期刊发表论文并成功申请至国内外知名高校
擅长把复杂论文转化为可落地科研路径,提供"方法设计—实验验证—论文投稿"全流程指导
课程构成: 12节小班课 + 2节1v1辅导
| 课节 | 课程标题 | 核心内容 |
|---|---|---|
| 第1节 | AI科研与多模态大模型入门 | 多模态大模型/CLIP概览、课程路线介绍 |
| 第2节 | Python与深度学习基础 | PyTorch基础、训练验证流程 |
| 第3节 | Transformer与ViT基础 | Attention机制、ViT结构解析 |
| 第4节 | CLIP原理与视觉语言模型 | 对比学习机制、跨模态对齐思想 |
| 第5节 | 序数学习(Ordinal Learning)基础 | 年龄估计/疾病分级/美学评分等典型任务 |
| 第6节 | OrdinalCLIP论文整体解析 | 方法逐模块拆解、创新点分析 |
| 第7节 | 数据集处理与实验框架搭建 | MORPH II等数据集、baseline搭建 |
| 第8节 | 等级语义学习 | Language Prototype、Rank Embedding |
| 第9节 | 实验细节与可改进 | Loss设计、训练技巧 |
| 第10节 | Few-shot与模型泛化能力 | 小样本序数任务、CLIP泛化分析 |
| 第11节 | 消融实验、可视化与论文表达 | Ablation设计、Attention可视化 |
| 第12节 | 创新拓展与投稿指导 | 个性化研究建议、论文写作与投稿路线规划 |
| 角色 | 职责 |
|---|---|
| 班主任 | 督学,跟进学习进度,规划全程进度管理 |
| 课程顾问 | 答疑、提供前沿文献资料与研究方法 |
| 主导师 | 授课,全程不定时答疑,提供方向性指导 |
| 代码导师 | 辅助教学,协助代码调试与技术落地 |
✅ 12节1v多小班研讨课(4–8人精品小组,每周1次,约90分钟/次)
✅ 2节不限时1v1深度辅导(个性化选题 + 论文修改 + 科研规划)
✅ 全程导师在线答疑(微信群,24小时内回复)
✅ 完整课程资料(论文精读笔记、代码模板、写作指南、投稿Checklist)
✅ 课程结束后3个月内持续跟踪辅导(投稿后修改、Rebuttal支持)
✅ 科研能力评估报告 + 符合条件者可获导师推荐信
✅ 课程永久回放,随时可学

扫码添加

添加学术顾问微信
免费获取服务方案
随着视觉语言模型(VLM)的快速发展,以CLIP为代表的大规模跨模态模型已展现出强大的视觉理解能力。然而,年龄估计、疾病分级、美学评分等视觉评分任务属于序数回归(Ordinal Regression),标签之间具有天然的连续性与等级关系。
传统方法将不同等级视为彼此独立的类别,导致模型难以真正理解"顺序"和"距离"背后的语义含义。本课题利用语言模型中天然蕴含的人类知识与顺序语义,将"年龄""病变程度""图像质量"等等级概念映射到统一的语言语义空间中,帮助模型建立更加连续、稳定且具有可解释性的表征。
关键词: MLLM、VLM、CLIP、语义对齐、Few-shot Learning、序数回归
| 创新点 | 目标区位 | 目标期刊 |
|---|---|---|
| 构建"正样本—邻近样本—远距样本"的序数对比学习框架 | CCF-A、CCF-B、SCI 1–2区 | ICCV、ECCV、IJCV、Neural Networks、KBS |
| 构建面向视觉评分任务的多模态大模型 | CCF-A、CCF-B、SCI 1区 | IJCAI、NeurIPS、ESWA、KBS |
| Concept-CLIP:不止学习标签,还要学习概念 | CCF-B、SCI 2区 | MICCAI、Neurocomputing、Neural Networks |
Tong老师,Top50高校计算机博士,从事医学图像计算、计算机视觉及多模态大模型应用的前沿研究。
多次在医学图像分析、人工智能、计算机视觉等领域的顶级国际会议发表高水平论文
主要研究方向:医学图像分割与疾病分级、多模态大模型指令微调、水质预测与知识蒸馏
指导过多名本科生及低年级研究生参与科研项目,多名学生在顶级会议及高水平期刊发表论文并成功申请至国内外知名高校
擅长把复杂论文转化为可落地科研路径,提供"方法设计—实验验证—论文投稿"全流程指导
课程构成: 12节小班课 + 2节1v1辅导
| 课节 | 课程标题 | 核心内容 |
|---|---|---|
| 第1节 | AI科研与多模态大模型入门 | 多模态大模型/CLIP概览、课程路线介绍 |
| 第2节 | Python与深度学习基础 | PyTorch基础、训练验证流程 |
| 第3节 | Transformer与ViT基础 | Attention机制、ViT结构解析 |
| 第4节 | CLIP原理与视觉语言模型 | 对比学习机制、跨模态对齐思想 |
| 第5节 | 序数学习(Ordinal Learning)基础 | 年龄估计/疾病分级/美学评分等典型任务 |
| 第6节 | OrdinalCLIP论文整体解析 | 方法逐模块拆解、创新点分析 |
| 第7节 | 数据集处理与实验框架搭建 | MORPH II等数据集、baseline搭建 |
| 第8节 | 等级语义学习 | Language Prototype、Rank Embedding |
| 第9节 | 实验细节与可改进 | Loss设计、训练技巧 |
| 第10节 | Few-shot与模型泛化能力 | 小样本序数任务、CLIP泛化分析 |
| 第11节 | 消融实验、可视化与论文表达 | Ablation设计、Attention可视化 |
| 第12节 | 创新拓展与投稿指导 | 个性化研究建议、论文写作与投稿路线规划 |
| 角色 | 职责 |
|---|---|
| 班主任 | 督学,跟进学习进度,规划全程进度管理 |
| 课程顾问 | 答疑、提供前沿文献资料与研究方法 |
| 主导师 | 授课,全程不定时答疑,提供方向性指导 |
| 代码导师 | 辅助教学,协助代码调试与技术落地 |
✅ 12节1v多小班研讨课(4–8人精品小组,每周1次,约90分钟/次)
✅ 2节不限时1v1深度辅导(个性化选题 + 论文修改 + 科研规划)
✅ 全程导师在线答疑(微信群,24小时内回复)
✅ 完整课程资料(论文精读笔记、代码模板、写作指南、投稿Checklist)
✅ 课程结束后3个月内持续跟踪辅导(投稿后修改、Rebuttal支持)
✅ 科研能力评估报告 + 符合条件者可获导师推荐信
✅ 课程永久回放,随时可学