用 Claude Code 转换图文到 Quarto Markdown 幻灯,我收获了什么?
(注:本文为小报童精选文章。已订阅小报童或加入知识星球「玉树芝兰」用户请勿重复付费)
痛点
隔三差五,就有星友问我:
王老师,哪个大模型做 PPT 比较好?
其实我早就给你推荐过 Gamma 。
你只要动动手指,它就能「一键生成」一套看起来相当精美的幻灯片。
这让很多人觉得,做幻灯的门槛消失了。
不过,尽管有这么多新潮的工具,我个人却一直坚守着一个看起来有点儿「原始」的选择 ——reveal.js。
没错,就是你平时看到我的视频里,白底黑字特别简约的这个界面。总有人误解我的幻灯为 PPT ,但不是,它其实是网页。
我一直对 PPT (PowerPoint Presentation,「微软 PowerPoint 幻灯片文件格式」) 的叫法有些抵触。它本来就只应该形容微软办公套件产品的。
我当然用过,而且差不多是将近 30 年之前就开始用。早先它那种封闭的格式,总让我感觉自己的心血被「锁」在了一个文件里。当然后来它现在早已经是 XML 变种,但毕竟只有微软自家软件才能做到最完美的兼容匹配。
从读博士到刚开始工作那段,我也时髦过一阵子,迷恋 Prezi 那种无限缩放的酷炫效果。可惜热情很快就退去了,因为我发现,每次想修改或者复用里面的资料,都痛苦不堪。正是这些经历,让我最终走向了基于 Markdown 纯文本的 reveal.js。
记得那是 2014 年学院青年教师教学基本功竞赛前一天晚上,我就是用 Markdown 把脑子里的思路梳理了一遍,然后敲了几行命令,一套包含图片、视频和动画效果的幻灯就流畅地跑起来了。第二天,我凭着这套幻灯拿了院里的一等奖,后来又得了校赛一等奖。从院赛到校赛之间,很多老教授帮我一遍遍打磨讲稿。靠着 Markdown 的简约高效,这种高频的修改我都做得很轻松。
从那以后,不管是平时给学生上课,还是做学术报告,甚至是在美国做文化讲座,Markdown -> reveal.js 都成了我的不二之选。它最大的魅力,就在于那个「纯文本」的核心 —— 所有的内容都是你可以随时搜索、编辑和整合的,还能和我用的 Roam Research 这样的大纲式第二大脑无缝衔接。知识的沉淀和迭代,从未变得如此简单。

后来,我开始在网上制作和发布教学视频,于是发现了一个从前没有的痛点 —— 把已经写好的图文资料,转换成幻灯展示。
我的核心需求其实很明确,就是想把一篇篇图文并茂的深度文章,浓缩成要点式的幻灯。这种幻灯片追求的是极致的简洁,每一页可能就一句话,甚至一个短语,用最精炼的语言把核心信息传递出去。
看起来,这没有什么困难的。毕竟把内容从短变长,是辛苦的;但是从长变短,看起来远为轻松。但是这个过程,其实也需要付出很多努力。因为文章写作的时候,为了强调重点、吸引读者,你可能加入大量冗余信息,也很口语化。但一旦缩短到幻灯片上,就像是「精确制导」,要求文字和图片必须配合得天衣无缝,一起撑起一个清晰的逻辑骨架。
几次折腾下来,我这个懒人受不了了。因为这简直如同重新创作了一遍,太麻烦了。
很自然地,2023 年起,我就想到让生成式 AI 来帮我自动化提炼幻灯。可没想到,最初的尝试却败得一塌糊涂。
彼时的 ChatGPT 3.5/4 版本在处理图文内容时有一个根本性的缺陷:它们虽然能读懂文字,却「看」不见图片。
在模型的眼睛里,一张图,无非就是一行代码链接,比如 。它知道这儿有张图,但图里画了什么、信息量有多大、和上下文是什么逻辑关系,它完全是一无所知的。
这就带来了三个绕不开的难题。
首先是「语义断裂」。比如原文里配了一张核心的架构图,之后有文字。因为 AI 看不懂图,它就没法判断图后面的文字是在解释这张图,还是在补充图里并不存在的新信息。这样提炼出来的要点,自然就抓不住关键。
其次是「排布混乱」。AI 分辨不出这张图是应该先展示出来作为引子,还是应该后出现作为证据。结果就是图文的逻辑关系乱成一团。要么是提前「剧透」,要么是重复说明,观众看得一头雾水。
最后,也是最麻烦的,是「逻辑跳跃」。图片往往是整个论证链条里非常关键的一环。当 AI 无法理解图片内容时,这个关键证据就丢失了,整个幻灯片的叙事逻辑就很容易会出现断层,缺乏说服力。
那么,有没有办法解决呢?
更多推荐


所有评论(0)