进阶篇:Codex + 四层结构,做到像参考图的可编辑 PPT
素材:同一份参考图Codex做4版PPT、GPT做PPT技能、GPT四层结构提示词 适合:要对标参考图、要像素级接近、要可编辑、要批量稳定出片 提示词原文 → 四层结构提示词库(复制即用)
一、先把话说准:什么时候需要这套
- 只想让 AI 出个能看的 PPT → 一段好提示词就够,用入门篇或现成框架
- 要照着一张参考图做出十分相似、还要可编辑的成品,尤其还让 AI 自己生图当素材 → 光靠提示词真到不了,要用这套四层结构 + 工程
提示词能说清「我要什么风格」,但它说不清「做出来跟参考图差多少、差了怎么补」。
二、Codex 是怎么做 PPT 的
Codex(OpenAI 能跑代码的 agent,底层 GPT-5)的玩法:
写 Python 代码调用生图模型生成素材(每个图标、每个插图都是单独的透明 PNG)→ 用 python-pptx 库把所有素材拼成真正的 .pptx 文件。
产出是能编辑的 .pptx,不是死图——文字、卡片、数据能改,图标插图能单独移动缩放。
三、核心:为什么必须分四层
AI 做 PPT 不分四层做,怎么改都不像。
这是从 v1 翻车到 v4 站住,踩了 4 版才想通的。中间的关键认知是一句话:素材是素材的事,排版是排版的事。 很多人做 AI PPT 只做了前 3 层,所以永远差一档。
第 1 层:背景层
每页一张生图背景或氛围图,放最底层。只管”氛围”,不管”信息”。 (比如 P1 的科技 AI 背景、P9 的夜景城市背景)
第 2 层:独立图片素材层
每个图标、插图单独生成透明 PNG,分别插入 PPT。可以单独移动、单独缩放、单独删除。 (粉丝图标能单独换、日历图标能单独调大、人物插图能单独换姿势)
第 3 层:原生可编辑内容层
所有文字、数字、页码、卡片边框、分隔线、按钮、圆角框,全部用 PPT 原生对象做,不要做成图片。这样文字能改、版式能调、数据能更新。
第 4 层:排版与视觉规范层(关键层)
控制字体、字号、字重、颜色、间距、对齐、圆角、线宽、密度、层级。 它决定的不是”能不能编辑”,而是”看起来像不像参考图”。 实现方式:把所有数值规格塞到代码里执行。
前 3 层解决”哪些东西可编辑、哪些素材可移动”。第 4 层解决”最终看起来是否像参考图、是否专业统一”。
四、v1 → v4 真实迭代(这段最值钱)
v1 翻车现场——对照参考图,六个问题全部命中:整体更空、图标偏细偏小像网页 icon、人物偏小偏中没了地台、剪贴板太实太蓝、背景星空太大没城市灯带、字体层级缩了一档。改了 3 次提示词都没救。

第一反应改提示词——把”modern Chinese presentation style”这种泛话换成写死的指令(图标提示词、人物提示词见提示词库)。跑出 v2,素材单独看像样多了。
v2 还是不像,问题在哪——图标、人物、背景单独看都好,但拼到 PPT 上整体还差一档。盯了很久才反应过来:
素材是素材的事,排版是排版的事。参考图的”贵气感”,更多来自字号字重、卡片大小、间距留白、对齐、圆角线宽——这些不是生图模型管的,也不是 python-pptx 顺手就能搞定的,要单独定一套规则。这才是 v2 差距的根因。

v4 突破:四层结构——按四层重做。背景层每页专门氛围图;独立素材层每个图标插图单独跑、抠绿幕;原生层用 python-pptx 写文字卡片分隔线;第 4 层把数值规格塞进代码执行。
跑出 v4:9 页 PPT,96 个可编辑文本,33 个独立图片对象,导出验证成功。对照参考图很像了——卡片饱满、图标粗了、字号上去了、人物到位、剪贴板淡了、城市背景出来了。(P2–P8 还稍微比参考图空一点,但整体站住了)

从 v1 踩坑到 v4 站住,核心不是改提示词,是想通”四层结构”这件事。
五、把它做成技能:gen-ppt
四层结构每次用都得重新跟 AI 讲一遍(背景层、独立素材层…还得叮嘱素材要生图别裁图),次数多了真烦。所以用 skill-creator 把整套提示词和步骤打包成一个技能,叫 gen-ppt——在 Codex 里打个 $gen-ppt 就能调起,不用再背一遍。

技能里加了两个原版没有的增量:
① 没有参考图也能开工:动手前先用生图模型生成 5 套完整参考图方案供你挑风格方向。先定准”要像谁”,AI 才不瞎做。(解决”手上只有主题、没有现成图”的情况)
② 合规分流:两条路线让你选 当你同时要求”素材全用生图”+“跟参考图一模一样”时,gen-ppt 会停下来让你二选一:
| 路线 | 做法 | 取舍 |
|---|---|---|
| A 生图合规路线(默认) | 素材全新生成,来源干净 | 版式能做很近,但人物不保证像素级一致 |
| B 精确复刻路线 | 人物等用参考图描摹矢量化 | 更像,但不算纯新生成 |
默认走第一条。我不想偷偷拿第二条冒充第一条,那是骗自己。
六、把相似度拉上去的,是”测量+回退”的工程
做到整套差距 0.198、单页平均 0.187(分越低越像),不是提示词写得好,是配了三样工程化的东西:
- 动手前先生成 5 套参考图让你挑方向 —— 先定准”要像谁”
- 一个脚本给每页打分,算跟参考图差多少 —— 能量化”像不像”,AI 才知道往哪改,而不是凭感觉
- 做歪了就回退重来 —— 靠一次次回退兜底,避免越做越差

这事跟芯片验证一个道理:提示词是规格说明(spec),负责说清”要什么”;但”做出来够不够像”是个要测量、要迭代的工程问题,不是把提示词改漂亮就能解决的。
七、最大的局限:人物插图做不到像素级
带人物插图的页(P1、P9)怎么做都差一截,最差到 0.31。想让生图模型照参考图 P9(比心人物)生一个一样的:第一版连底部波浪也生进去了(0.307→0.385,更差);拿参考图当视觉参照重生,姿势像了但人脸身体色块太大(0.35,还是更差)。来回试几次全回退了。

想通的一件事:
纯生图能保证素材都是新生成、来源干净、不抄图。但它保证不了人物插图跟参考图像素级一模一样——模型每次生出来的人都不一样,你让他比心,他可能顺手再给你画条波浪。“素材全用生图”和”跟参考图一模一样”这俩要求有时候是打架的。
所以才有上面的两条路线分流。接受不了人物不一致,就走描摹那条路。
八、怎么落地(最小步骤)
- 装 Codex(OpenAI 命令行 AI,见工具篇/Codex 上手)
- 用 skill-creator 把四层结构提示词打包成 gen-ppt 技能,放进
~/.codex/skills/ - 有参考图就上传;没有就让 gen-ppt 先生 5 套方案挑一个
- 跑四层结构 → 导出 .pptx → 3×3 接触表逐页对照 → 不像就回退重调
- 验收清单见 → 避坑与验收清单
那套四层结构提示词更通用,喂给任何一个能跑代码又能生图的 AI 都能用,这部分是真的复制就能用。提示词原文 → 四层结构提示词库(复制即用)