Gemini 3.5看图写小说实测:蛙趣拼文接入多模态AI,角色立绘直接变文字
Gemini 3.5能"看"图了——我把我的火柴人角色立绘扔进去,它居然认出来了
Google在5月I/O大会发布了Gemini 3.5,原生多模态——文字、图片、视频一起理解。蛙趣拼文接入后,作者可以直接把角色立绘、世界地图扔给AI,AI"看着图写"。本文是一个不会画画的网文作者从火柴人到精美角色描写的真实经历。
我先声明一件事。
我不会画画。
我画的人物——脸是个圆,身子是个方框,四肢是四条线。我的美术老师说这是"极简主义"。我觉得他在阴阳我。
但是!我写小说的时候,脑子里是有画面的。
主角长什么样、穿什么衣服、发型是啥、走路姿势帅不帅——全在我脑子里。就是画不出来。每次给AI描述角色外貌,我都要写一大段文字:"他有一双狭长的眼睛,眼角微微上挑……"每次都要写一遍。写到第80章的时候,我已经烦了。
然后上个月,我表哥又来了。
(对。就是那个在软件公司上班的表哥。他简直是我的AI写作顾问。)
他说:"你知道吗,Google出了个新模型叫Gemini 3.5。这个模型超猛的——它能看图。"
"看图?"
"对。你把一张图扔给它,它能理解图里有啥。然后根据图片写东西。"
"……你认真的?"
"蛙趣拼文已经接上了。你试试。"
我的火柴人立绘
我决定做一件很蠢的事。
我把我的火柴人角色图发给了表哥,让他帮我导进蛙趣拼文+Gemini 3.5。
我的火柴人长这样——一个椭圆形的脑袋,两个点当眼睛,一条横线当嘴。身上套了个三角形的"披风"。手里有一把疑似剑的线条。
我自己都觉得丢人。
然后表哥让Gemini 3.5"看"这张图。Prompt写的是:"请根据这张角色立绘,用网文风格写一段外貌描写。"
三秒钟。
Gemini 3.5吐出来的东西——
"他站在月光下,斗篷被夜风拉扯出猎猎的声响。帽檐压得很低,只露出半张脸——瘦削的下颌,嘴唇抿成一条薄线。那只没有完全被帽檐遮住的左眼,在月光下反射出一种接近琥珀色的浅光。
他的手扣在剑柄上。剑没有出鞘。但那个握姿——随时可以出鞘。"
我当时在屏幕前,整个人是傻的。
不是。这谁?
我的椭圆形脑袋呢?我的两个点当眼睛呢?
AI看了我的火柴人,然后脑补出了一个完整的帅逼。
我突然就理解了什么叫"创作辅助"。
Gemini 3.5不是单纯复刻你的图片。它是理解图片里"有什么元素",然后基于这些元素做文学生成。我的火柴人虽然丑,但它有斗篷、有剑、有遮住脸的帽子——Gemini 3.5把这些元素拎出来,填上了它自己的想象力。
当然也有翻车的时候。
有一次我画了个"高冷御姐"——尖下巴、长发、冷脸。Gemini 3.5给我描述成了"她的眼神像一月的冰面,薄、冷、一踩就碎。"
碎?
我写的可是玄幻小说。不是文艺片。
后来发现是提示词没写清楚风格。加了一句"玄幻战斗向"就好了。
多模态写小说,不只是看图
我表哥跟我说,Gemini 3.5的多模态不止是看图。
它还能看世界地图。你把你自己画的小说世界地图扔给它。标注了城市、山脉、势力范围。它看完之后,能直接生成一段——"主角从青云城出发,穿越雾霭山脉,三天后抵达北境的流沙堡。"路程、距离、地势——全对。
还能看场景参考图。你要写一个古风宫殿——扔一张故宫的图。Gemini 3.5"看完"之后,写出来的场景描写明显有画面感了。不是"大殿金碧辉煌"那种套话。是"朱漆柱子上的裂纹""被香火熏黑的横梁""台阶的棱角被踩圆了"——这些细节。
说真的。这些细节不是AI编的。是它在图里"看到"的。
行业背景——AI看图的时代来了
我表哥给我看了几个数据。
Google在5月份的I/O大会上说,Gemini 3.5是一个"原生多模态"模型。什么叫原生多模态?就是它从一开始就用文字+图片+视频一起训练的。不是"先学文字再补修看图"——是一起学的。
然后7月份Gemini 3.5 Flash也变成主力了。速度快得飞起。价格便宜。上下文100万Token。
但多模态写小说这件事,目前用的人还不多。
我问我表哥为啥。他说因为大部分写小说的工具没接多模态模型。你光有个Gemini 3.5的API,没有工具帮你管理图片素材、组织创作流——用起来特别麻烦。
蛙趣拼文是把图片素材跟写作流打通了。你的角色立绘、世界地图、场景参考——全放在项目里。写章节的时候一键调。不用切窗口。不用复制粘贴。
然后Gemini 3.5就看图。看图。然后写。
一个我没想到的好处
素材库变"轻"了。
以前我的素材库全是文字——词汇、句式、对话风格。每次要找什么都要搜半天。现在多了一个东西——图片。
一张图有时比五百字的素材更管用。
你要写一个"苍凉的边境小镇"。以前你在素材库里搜"苍凉""边境""小镇",搜出来一堆相似的词。现在——你丢一张黄土高原废弃村落的照片。Gemini 3.5看完,自己写。
这种感觉就像——
以前你给AI一堆形容词让它脑补。现在你直接给它看。
当然。
多模态这个功能目前还在完善中。有时候图片太抽象,AI会跑偏。有时候色调和氛围没对齐,写出来的东西跟你想象的不一样。
但方向是对的。
我有一个预感——再过半年,写网文的人管角色外貌的方式会彻底变。不再写千字人物设定了。直接丢一张立绘。AI看图。然后写。
我指的是那种"辅助创作"不是那种"全自动灌水"。
番茄6月份封了49个金番、15万本书——那都是灌水。用AI看图写角色描写——这是效率。不是灌水。
说句实在的。我上次那本小说的角色外貌,写到第80章之后我自己都记混了。主角到底是丹凤眼还是桃花眼来着?翻回第3章确认——哦,写的"狭长"。但第45章我好像写过一次"圆润"。
如果有Gemini 3.5+蛙趣——我把立绘一丢。AI看图写。永远长那样。
反正比我准。
常见问题
Q:Gemini 3.5看图写小说适合什么人?
A:脑子里有画面但画不出来的作者(比如我)。有大量角色立绘和世界地图需要AI"看懂"的创作者。经常写到后面忘了角色外貌的作者。不适合只想用纯文字提示词的——用别的模型更便宜。
Q:AI看图写出来的东西会不会跟别人的撞?
A:你喂的图是你自己的——你的火柴人、你的地图、你的参考图。AI基于你的图生成,生成结果跟别人的图不一样。跟用公共提示词完全不一样。加上蛙趣的素材库和去AI味精修,撞内容的概率极低。
更多推荐
所有评论(0)