公开课
免费 AI / 数据科学求职备考直播课,查看即将开始与往期回顾。
即将开始
往期公开课
🤖大语言模型
100天掌握大语言模型第二十周:多模态 LLM
已结束大语言模型
ChatGPT 能够识别图片、Gemini 可以理解视频、GPT-4V 能分析图表和文档……AI 正从“理解文字”迈向“理解世界”。
在本周 100 Days to Master LLM 系列课程中,我们将带您深入学习 Multimodal LLM(多模态大语言模型) 的核心技术,全面解析 AI 如何同时理解 文字与图像,以及这一技术如何推动下一代 AI 应用的发展。
本次课程将系统介绍:
✅ 为什么多模态是未来 AI 的核心方向
✅ CLIP 与 Vision Transformer (ViT) 如何让模型“看懂”图片
✅ LLaVA、GPT-4V、Gemini 等主流多模态模型架构解析
✅ 多模态模型训练流程与 Vision-Language Alignment 技术
✅ OCR、Document AI、图表分析、Visual QA 等企业级应用场景
✅ 开源与商业模型的能力、成本及部署方案比较
如果您希望成为 AI Engineer / LLM Engineer,未来不仅需要掌握文本模型,更需要理解多模态 AI 的设计与实现。本课程将帮助您建立完整的多模态技术体系,理解目前业界最先进模型背后的设计思想,并掌握实际项目中的技术选型。
欢迎参加本周 Webinar,与我们一起进入 AI 的下一个时代——让模型不仅能够思考,更能够“看见”世界。
2026年7月30日星期四
19:00
🤖机器学习 深度学习
