生成式人工智能行业应用实战(慕课版)
北京航空航天大学 29系人文与社会科学高等研究院 清华大学 新闻与传播学院、人工智能学院 双聘教授 @新媒沈阳 团队何静(副教授)(一篇科普报告每多一个公式读者数量就减半。该报告仅用于科普,面向对象为小白。)生成式人工智能应用实战(慕课版)第1章:AI 与 AIGC 概述AI是什么?AI:人工智能(Artificial Intelligence),指让机器具备像人一样思考、学习和决策的能力。通俗来讲,它就像给机器装上了一颗大脑,让他们不再是简单的工具,而是能理解我们,陪伴我们,和我们一起学习的伙伴。感知人类能分析信息、做出判断,比如“这动物是不是猫?”AI会根据已有的数据和模型,计算出最可能的答案 比如 AI识图时,判断这张图更像“猫”还是“狗”决策人类面对选择会“判断利弊”然后行动AI也能基于计算结果“做出最优选择” 比如导航系统根据路况决定推荐哪条路线 推荐系统根据你行为,决定给你推什么短视频学习人类通过模仿、练习、总结来获得经验和知识AI通过分析海量数据来学习,“消化”的数据越多,就会变得越“聪明” 人学认猫:看几只猫,老师讲一讲,就记住了 AI学认猫:看10万张猫的图片,从中总结“猫的特征”推理人类用眼睛看、耳朵听、手触摸等等来感受外部世界AI可以用摄像头“看”、麦克风“听”、传感器“触摸”这4步很像人类的大脑“从看到 → 到思考 → 再行动”的过程日常中的案例 人们用眼睛看,AI用摄像头“看”手机能认出照片里的人是不是你 人们用耳朵听,AI用麦克风“听”你说“嘿Siri”手机就会回答你 人们学习知识,AI从数据中“学习”让AI看10万张猫的照片,它就能学会认猫 人们思考决策,AI计算后“做决定”地图APP帮你选出不堵车的最快路线AI 是如何学会的?AI 并不是程序员写死一堆规则,而是通过“学习”来获得“智能”机器学习靠人“讲重点”,深度学习自己“抓重点”人工智能 vs机器学习 vs 深度学习人工智能是总目标:让机器变得“像人一样聪明”机器学习 是达成这个目标的关键方法之一,通过大量数据自己“总结规律”深度学习是机器学习里目前最强的技术路线,模仿人脑结构,自动“分层”提取信息123举例(识别猫)举例(识别猫)喂它猫的图,人还要提前告诉它“猫耳朵尖、有胡须”等特征喂它猫的图,但不用人告诉特征,它能自动从图像中“学”出这些特征(耳朵、胡须、眼神等)对比点机器学习(ML)深度学习(DL)特征提取人工设计AI 自动学出来适用任务简单结构化任务(分类、推荐)复杂任务(图像、自然语言等)类比老师教学生学生自学AIGC是什么?生成内容类型示例代表性工具 文字写作文、写脚本、写代码DeepSeek、文心一言、ChatGPT 图像画头像、插画、设计草图即梦、豆包、Midjourney音频AI 配音、朗读文章、变声效果海绵音乐、网易天香、suno 视频数字人解说、AI换脸、视频生成可灵、海螺、soraAIGC:AI Generated Content,又称生成式AI,是“AI生成内容”的意思。它是指人工智能不仅能“识别”、“判断”,还可以主动“创作”出新的内容,比如文字、图像、音乐,以及视频。深度学习的两种模式判别式生成式喻为:分类大师任务:区分 & 判断典型应用:人脸识别 → 张三 or 李四?情感分析 → 正面 or 负面?喻为:创造大师任务:理解 & 创造典型应用:广告文案生成→ 创意营销内容医疗辅助诊断→ 给出诊断建议AIGC 是如何生成内容的?学习(训练阶段)创造(生成阶段)投喂数据:让机器看无数张猫咪照片提炼规律:猫的典型特征:耳朵、眼睛、鼻子、胡须、尾巴…特征有无数种组合:大耳朵/小耳朵,蓝眼/绿眼,长 毛/短毛,姿势各异结果:机器在脑中形成了“猫的灵魂概念”能区分“什么是猫,什么不是猫”AIGC 能生成内容,靠的是“三件法宝”——数据、模型、算法关键要素作用解释训练数据学习素材AI 看了海量文本/图像,学会了“怎么说话、怎么画图”大模型理解能力像“看过几百万本书”的AI大脑,能理解你的要求生成算法表达能力像“动笔写作/动手画图”的过程,把想法输出成作品输入:给出提示(如“躺在沙滩上打哈欠的猫”)输出:不会照抄原图基于“猫的灵魂概念”自由组合 → 全新猫的形象特点:真实又独特,从未存在过,但完全符合“猫”的特征大模型是什么?大模型:Large Model。是指在海量数据和算力支持下训练出的、参数规模庞大、具备跨领域泛化和生成能力的人工智能模型。常见大模型对话产品注意:对话产品和基座大模型实际上是两个东西厨房类比生成式AI 文字大模型图片大模型整个厨房苏菜厨师 → MidJourney、Stable Diffusion粤菜厨师→ Suno AI、Udio AI川菜厨师 →ChatGPT DeepSeek大模型厨房里专门做某类菜系的厨师音乐大模型视频大模型鲁菜厨师 → 即梦、可灵类型代表产品模型类型说明文生文ChatGPT、DeepSeek大语言模型文生图MidJourney、Stable Diffusion图像生成模型文生音乐Suno AI、Udio AI音乐生成模型文生视频即梦、可灵视频生成模型大模型的原理是什么?第一步学霸读遍互联网上的书、文章、网页,目的不是“背书”,而是 总结语言规律例子:“中国的首都是___” → 北京;“猫喜欢吃___” → 鱼 / 老鼠海量读书(训练) 它会判断每个词跟其它词的关系有多重要 结果:形成一个复杂的 概率网络(神经网络)第二步用户提问 → “为什么天空是蓝色的?”学霸将问题切分成 Token(词或字碎片)操作步骤类比说明把句子拆成 Token把一句话像拼图一样分成一个个“词块”遮掉一个词模型猜这个词应该是什么猜得准就得分,错就调整模型通过反复猜 → 更新参数 → 越猜越聪明第三步像玩“疯狂填词”一样,逐字逐词预测接到问题(输入)预测下一个字(生成)根据问题,选出最合理的开头词→例子:“为什么天空是蓝色的?” → 最可能的开头是 “因为”逐字逐词预测下一个最合理的词→ 例子:“因为” → “太阳” → “光” → “进入” → “大气层” → …不断调整句子结构,保证通顺和逻辑→ 最终生成完整答案“因为太阳光进入大气层后,发生了瑞利散射...”Token(词元)是大模型“看懂语言”的最小拼图单位.大模型类似于一个 “超级学霸”。这个学霸的学习和思考过程主要分三步:大模型就是一个 “根据输入,预测下一个最可能出现的词” 的超级机器。 但,它有时候会犯错(猜错词),或者编造信息(因为它的目标是让句子看起来合理,而不是100%正确),就像学霸有时候也会凭感觉答错题一样。智能体是什么?智能体:英文是Agent,是一种具有感知、决策和行动能力的实体,它生活在电脑、手机、互联网里,能理解任务 → 自主分析 → 自动执行对比维度一般 AI 模型智能体(AI Agent) 角色定位被动工具(像搜索引擎、问答机器人)主动助手(像私人助理、执行机器人)工作方式一问一答、输出结果,完成一小步就结束拆解任务、制定计划、执行多步行动,直到完成目标 主动性 没有主动性,只能等用户发指令有主动性,会根据目标自己思考和行动 示例行为回答问题、翻译
[北京航空航天大学&清华大学]:生成式人工智能行业应用实战(慕课版),点击即可下载。报告格式为PDF,大小3.05M,页数14页,欢迎下载。



