在上一节课中,我们介绍了目前市面上常见的几种 AI 生成 PPT 的技术方案,并重点说明了 模板填充 PPT 是目前最稳定、最适合产品化落地的一种实现方式。
但如果真正去实现一个完整的 AI PPT 生成系统,仅仅知道用模板填充其实还远远不够。因为在实际产品中,从用户输入一个主题到最终生成 PPT,中间还会经历一系列复杂的步骤,例如 需求澄清、信息检索、内容规划、素材准备以及最终渲染 等。
因此,在开始实现之前,我们需要先做一件非常重要的事情:需求分析。
在本节课中,我们就 豆包PPT 生成功能为例,分析它的完整生成流程,并理解一个工业级 AI PPT 系统背后的设计思路。
通过拆解真实产品的实现逻辑,可以帮助大家更清晰地理解:一个 AI PPT 生成系统到底需要哪些核心能力,以及这些能力之间是如何协作完成任务的。

需求澄清
当用户打开 AI PPT 生成工具时,通常只会输入一个非常简单的需求,例如:
但这个需求对于系统来说其实是 不完整的。
因为一份 PPT 的生成通常还需要很多关键参数,例如:
- PPT 页数
- PPT 风格
- 主题
- 使用场景(汇报 / 教学 / 宣讲)
如果系统在信息不完整的情况下直接生成 PPT,很可能会出现一些问题,例如页数不符合预期,或者视觉风格不符合用户需求。
因此像豆包PPT这样的产品,在真正开始生成 PPT 之前,通常会先进行一个 需求澄清阶段。
在这个阶段,系统会判断用户输入的信息是否完整。如果发现关键信息缺失,就会主动向用户进行补充提问,例如:
- PPT 需要多少页
- 什么风格(科技风 / 商务风 / 简约风)
- 什么主题
当这些信息补充完整后,系统才会进入下一阶段的 正式生成流程。
这种设计方式其实是很多 AI Agent 系统中的常见策略,本质上就是通过 多轮对话补齐任务参数,让后续生成过程更加可控。
数据收集
当用户需求明确之后,系统接下来要解决的问题是:PPT内容从哪里来?
如果仅仅依赖模型本身的知识,很容易出现两个问题:
第一是 信息不够新。
第二是 内容不够具体。
因此像豆包PPT这样的系统,通常会在生成 PPT 内容之前,先进行一轮 数据查询与信息收集。
例如在生成“大模型应用场景”这个主题时,系统可能会搜索一些相关信息,例如:
- 大模型最新应用案例
- 大模型在内容创作领域的应用
- 大模型在代码开发中的应用
- 大模型在教育、客服等行业的应用
通过这种方式,可以获得大量真实案例和数据,从而让 PPT 的内容更加丰富和可信。将这些信息作为参考数据提供给模型。

全局视觉设计
在数据准备完成之后,系统并不会马上开始生成每一页 PPT 的内容,而是先进行:整体视觉设计规划。
这一阶段的目标是确定整个 PPT 的 统一视觉规范。
例如在豆包PPT的生成流程中,系统会先确定一些全局设计参数,例如:
- PPT整体风格
- 页面尺寸
- 字体系统
- 配色方案
- 页面结构规范
例如在“大模型应用场景”的案例中,系统最终选择的是 科技简洁风格。
设计思路大致是:
- 使用深色背景体现科技感
- 使用亮色文字提高可读性
- 使用简洁布局避免视觉干扰
同时系统还会确定一套统一的字体体系,例如:
- 标题字体
- 正文字体
- 标题字号
- 页面边距
这些信息在后续生成 PPT 时都会被统一使用,从而保证整个 PPT 在视觉上保持一致。

大纲生成
当视觉规范确定之后,系统接下来会生成 整份 PPT 的结构大纲。 这一阶段的目标是确定: - PPT 一共有多少页 - 每一页的主题是什么 - 页面之间的逻辑关系 例如在“大模型应用场景”这个案例中,系统最终规划出了这样一套结构: 1. 封面 2. 目录 3. 引言 4. 内容创作应用 5. 代码开发应用 6. 数据分析应用 7. 教育领域应用 8. 客服领域应用 9. 挑战与展望 10. 总结 可以看到,这其实是一种非常典型的 演讲型 PPT 结构: 引入 → 分主题讲解 → 总结展望。 在真实产品中,大纲生成通常是整个流程中非常关键的一步,因为 后续所有页面内容都会基于这个结构展开。
页面内容
在大纲确定之后,系统才会开始进行 每一页 PPT 的内容设计。
这一阶段主要解决两个问题:
第一是 页面内容规划。
第二是 页面布局设计。
例如在介绍“代码开发应用”这一页时,系统可能会规划出这样的内容结构:
- 代码生成
- 代码补全与优化
- 真实案例
这种结构其实是一种典型的 三点式表达结构,既能够保证内容清晰,又方便在 PPT 中进行排版。
同时系统还会设计页面布局,例如:
- 标题放在页面上方
- 内容在左侧
- 图片在右侧
通过这种方式,可以保证每一页 PPT 的信息结构都比较清晰。

素材准备
在页面内容规划完成之后,系统接下来需要准备 视觉素材。
通常会包含两种类型的素材:
第一种是 背景图生成。
例如封面页、总结页等页面,系统可能会通过文生图模型生成一张统一风格的背景图,例如:
- 科技风神经网络背景
- 抽象数据流背景
- 未来科技风格背景
第二种是 内容配图。
例如:
- AI大脑示意图
- AI辅助编程场景
- 数据分析可视化图
- AI教育场景
这些图片通常会通过文生图或者网络搜图来实现。

PPT生成与渲染
当所有内容和素材都准备完成之后,系统最后会进入 PPT生成阶段。 在这一阶段,系统会根据之前确定的: - PPT大纲 - 页面内容 - 背景图片 - 内容配图 - 视觉规范 将所有信息填充到 PPT 模板中,生成最终的 PPT 文件。 整个过程通常是通过一个 PPT生成工具完成的,例如程序自动创建幻灯片、插入文本框、设置字体样式、添加图片等。 当所有页面生成完成之后,系统就可以输出最终的 PPT 文件,并提供下载给用户。
整体流程
从整个流程来看,一个完整的 AI PPT 生成系统通常会经历这样几个阶段:
用户需求输入
↓
需求澄清
↓
数据查询
↓
视觉规划
↓
大纲生成
↓
页面设计
↓
素材准备
↓
PPT渲染生成
可以看到,这其实已经不是一个简单的文本生成任务,而更像是一个 多步骤的任务执行流程,也就是 worflow agent。 在接下来的课程中,我们也会参考类似的思路,不完全和豆包的实现方式一致,一步一步实现一个完整的 AI PPT生成智能体。