AI+影视:从漫剧到长剧,内容生态将如何演变
AI+影视:从漫剧到长剧,内容生态将如何演变证券分析师:李景星执业证书编号: S0370522090001研究助理:谭景文执业证书编号: S0370125070004行业评级:增持(维持)证券研究报告传媒行业/行业深度报告2026年9月30日目录一、多模态技术与全球竞赛二、为什么着重关注AI+影视产业?三、AI技术如何重构内容生态?四、投资建议及相关标的五、风险提示核心观点•原生全模态成为主流,全球图生视频模型能力排行榜前十名中,中国占七席。随着技术迭代,视频内容稳定性、连贯性得到大幅提升,全流程采用AI制作长内容成为可能。因此,AI影视的内容形式也从短剧向长剧、电影升级,打开了更加多元的变现空间。高度精品化内容产品对应更高程度的用户直付,IAA模式到长视频会员,再到电影票款,AI+影视的变现密度将得到大幅提升,也反哺AI影视走向精品化。据DataEye数据预估,2026年AI短剧市场规模有望突破400亿元。我们预计AI短剧市场将保持高速增长,有望成为微短剧市场的主流供给形态。随着AI影视内容形式的演进,AI影视总盘子有望向长剧、电影市场进一步扩容。•从需求端来看,如果以日本为鉴,内容产业具备一定的跨周期特征。与此同时,短剧视频是当前互联网产品中最具成长性的品类,物质消费向精神消费升级时期,AI+影视成为激活大众消费的重要力量。从供给端的角度,阿里、腾讯、字节规划投入合计近万亿元,竞争升级为资本、算力和创作入口卡位。•综合来看,AI影视的变现确定性看IP和工具,弹性看平台和出品方。具备精品化制作和IP长线运营能力的出品方收入潜力最大。2026年第四季度到2027年上半年进入密集验证期,我们将持续跟踪长内容备案情况与市场反响。IP版权方:阅文集团、中文在线、掌阅科技AI工具方:昆仑万维、捷成股份、万兴科技内容出品方:光线传媒、中国电影、华策影视、上海电影、博纳影业平台与渠道:芒果超媒、腾讯控股、阿里巴巴、哔哩哔哩注:以上标的中,中国电影 (600977.SH,增持),其余均未评级。【风险提示】竞争加剧风险;付费率不及预期风险;监管趋严风险;技术更新不及预期风险;AI生成内容接受度不佳风险;AI伦理道德风险等一、多模态技术与全球竞赛多模态技术是什么?多模态技术是指通过融合图像、文本、音频、视频等不同模态的数据,实现跨模态信息的协同建模,从而提升大模型的理解与推理能力。这一技术在内容生产、人机交互、自动驾驶、医疗诊断等场景中具有广阔的应用前景。为什么内容生产必须使用多模态技术?视听内容天然音画一体,单一模态难以满足制作需求。而多模态技术可以让大模型同时“看懂画面、听懂声音、读懂语境”,还可以生成音画同步的视频产物。统一建模后,参考图、参考视频、语音、运镜、剧本等均可作为多模态控制信号,在影视领域可以为规模化生产内容提供统一底座,让内容更具一致性。在训练、生成多模态信息时,如何进行“预测下一词元”(Next Token Prediction)是关键,其路径大致可分为离散词元预测与连续词元预测两类。两种路径各有长短,适用于不同场景。参考资料:CHEN Liang, et al. Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey[J]. arXiv:2412.18619, 2024.多模态技术的工作原理多模态信息输入,经过编码器后,被量化(Quantization)为离散词元或者被投影(Projector)转化为连续词元。词元输入至Transformer架构中进行建模,通过Transformer 解码器输出,执行“预测下一词元”(Next Token Prediction)。“预测下一词元”分为:•离散词元预测:文本词元直接预测目标文本;量化词元通过VQ解码器还原为图像。•连续词元预测:直接输出预测图像,或通过扩散模型从潜在变量生成图像。离散词元预测连续词元预测本质从有限的词表里分类选序号在无限空间里回归算数值代表技术LLM、VQ-VAE、VQ-GAN、多模态理解模型(如LLaVA)扩散模型、VAE计算方式算概率(Softmax)算距离(MSE)优点逻辑推理、语义理解能力强,擅长抽象符号建模,与现有LLM架构天然兼容,训练稳定性高视觉细节丰富、光影平滑、物理连续性强缺点词汇表有限,容易丢失细节理论上拥有无限空间,容易出现过拟合或生成不存在的事物概念适用场景适用于多模态理解、图文问答、逻辑推理、离散视觉生成,不适合生成长视频适用于生成高保真图像、视频、实时渲染,以及模拟物理世界1.1 多模态技术驱动内容生产方式变革1.2 技术趋势:从拼接走向原生全模态,下一程驶往NSP下一程驶往NSP:从“预测下一词元”到“预测世界下一状态”•《2026年十大AI技术趋势》指出,“预测世界下一状态”(NSP)已经成为AGI共识方向。当前AI影视核心瓶颈是“抽卡”,尽管当前多模态视频工具已经可以生成视觉效果逼真的视频,但视觉逼真≠物理理解,在“预测下一词元”(NTP)的范式下,模型对流体、光学、固体力学等原理掌握不足。NSP则能够从多模态数据中学习物理动态、时空连续性与因果关系,形成“理解-预测-规划”的闭环,推动AI从感知走向认知。•NSP可以为AI影视破解两大瓶颈:一是提升单次抽卡成功率,减少站位穿插等违背物理的问题;二是提升长时一致性,解决镜头切换后建筑结构变化、道具漂移等场景漂移难题,推动AI视频从“能生成”迈向“工业化生产”。多模态大模型主流架构:从“拼接式”到“原生全模态”• 过去的对话式多模态模型经常采用“视觉编码器+投影层+语言模型”的拼接式架构。• 2023-2024年,原生多模态架构在旗舰模型中确立为主流方向,大模型厂商在预训练阶段就将文本、图像、音频等模态编码后的Token放入同一个Transformer进行联合训练。• 2024年以来,业界对于基础模型的训练逐步收敛到“预训练+后训练”范式,OpenAI、Google、xAI等发布的系列模型反复验证了两阶段Scaling Law(规模定律)的有效性。OpenAI推出GPT-4o,多模态进入Omni时代,将多模态能力从“统一预训练”推进到“实时统一交互”,接受文本、音频、图像的任意组合输入,并实时生成文本、音频、图像输出。参考资料:智源研究院《2026十大AI技术趋势》,金元证券研究所整理排名模型开发商技术架构架构所属类别信号类型1Minimax H3 Max(post-trained by fal)MiniMax、fal33B Dense Single-Stream Omni Transformer原生全模态连续投影2Dreamina Seedance 2.5/2.0字节跳动双分支扩散 Transformer(DB-DiT)双流联合生成连续投影3MiniMax H3MiniMax33B Dense Single-Stream Omni Transformer原生全模态连续投影4Gemini Omni FlashGoogle原生多模态 Transformer原生全模态连续投影5grok-imagine-video-1.5xAI自回归MoE Tr
[金元证券]:AI+影视:从漫剧到长剧,内容生态将如何演变,点击即可下载。报告格式为PDF,大小2.38M,页数30页,欢迎下载。



