动态 9 分钟阅读

AI生图-4K、8K、highly detailed —— 这些词,终于可以扔掉了

我在利用 AI 搜集整理推特的Midjourney prompt 模板库,翻到了一个 2023 年的模板。标题写的是「AI 绘图:教你几个提示词 100% 生成美丽小姐姐」。我点进去一看,那个 prompt 长这样:

1girl, masterpiece, best quality, high resolution, 8K, HDR, cinematic lighting, detailed shadows, ray tracing, bokeh, depth of field, film photography, film grain, glare, beautiful face, hyperdetailed, outdoors

23 个词。其中 17 个是质量修饰词。

我当时就笑了。不是因为 2023 年的自己蠢——那时候大家都这么写——而是因为这 17 个词放到今天,有一半不仅没用,还会让画面反而变差。

不是。

连「反而变差」都不准确。

更准确的说法是:这些词从「必须加的魔法咒语」变成了「什么都不说也不会丢的东西」。

用经济学的话讲,经历了三年的 prompt 通胀之后,我们正在进入 prompt 通缩。

「4K」这个词,到底是怎么统治了所有人的 prompt

你如果关注这个领域的话,可能已经注意到一个现象——从 2023 年到 2025 年,AI 图像生成的 prompt 经历了一个越来越臃肿的过程。

2022 年,Stable Diffusion 1.4 时代。那时候的生图质量,说句不好听的,纯看运气。你打一句「a girl」,出来的可能是一个长着三只眼睛的恐怖生物。手是肯定废的。脸大概率是崩的。背景像是 Windows 画图随便涂的。

然后有人发现了一个秘密。

在 prompt 里加上「masterpiece, best quality」,出图质量会显著提升。不是玄学。不是 placebo。是真的有区别。

为什么?

因为 SD 1.4 的训练数据里,「masterpiece」和「best quality」这两个标签,是被标注在那些真正高质量的训练图片上的。当你在 prompt 里写这两个词,你本质上是在告诉模型:请从训练数据的高质量子集中采样。这就像你去图书馆借书,不说书名,只说「给我最好的那几本」。虽然模糊,但确实有用。

然后「4K」「8K」「HD」「HDR」也加入了这个行列。逻辑是一样的——这些词在训练数据中关联的是高分辨率的、专业的、精修过的图片。你加上它们,模型会倾向于从那些更高清的样本空间里取特征。

然后「ultra-detailed」「intricate details」「sharp focus」「ray tracing」也进来了。每个词都是一个信号:「请把细节拉满」。

到了 2023 年中,一个「标准」的 SD 提示词已经长成这样了:

masterpiece, best quality, 8K, HDR, ultra-detailed, intricate details, sharp focus, ray tracing, professional lighting, cinematic lighting, photorealistic, hyperrealistic

12 个词。全部是「质量咒语」。占了整个 prompt 的一半。而且每个人都在用。不管你是画一个城堡,还是一个汉堡,还是一个赛博朋克猫——前面 12 个词一模一样。

我记得 2023 年底有一个梗图特别流行:一个巨大的文件夹,里面分类了「fantasy prompt」「portrait prompt」「food prompt」「architecture prompt」,但每一类的第一行都写着「masterpiece, best quality, ultra-detailed, 8K」。

这就是 prompt 通胀的第一阶段。

第二阶段:从「质量词」升级到「电影词」

2023 年底,Midjourney V6 发布。2024 年 8 月,FLUX.1 发布。

模型质量上来了。SD 1.5 需要「masterpiece」来避免生成垃圾,但 MJ V6 和 Flux 默认就已经是 masterpiece 了。

于是 prompt 通胀进入了第二阶段。不是停下来,而是换赛道。

「4K」「8K」「HDR」「masterpiece」这些词还在用——因为大家都习惯了,而且去掉它们感觉不放心——但社区开始填充新的词来替代那些已经失效的老词。

这次升级的方向是「电影感」。

「cinematic lighting」。这个词在 2024 年成了新的万能填充词。它在 Midjourney V6 和 Flux 的早期版本里确实有效——不是因为它触发了什么特殊的电影渲染模式,而是因为它触发了训练数据中所有被标注为「电影感」的图片的共同特征:侧逆光、暖色调阴影补冷色、宽画幅构图、柔和的景深过渡。

然后「film grain」「anamorphic lens」「shallow depth of field」「bokeh」「Kodak Portra 400」「teal and orange color grade」全来了。每个词都是一个「让画面看起来更电影的」信号。连在一起,就是:

cinematic lighting, film grain, anamorphic lens, shallow depth of field, bokeh, teal and orange color grade, moody atmosphere, Kodak Portra 400

又是 8 个词。又是每个人都在用。

到了 2025 年初,prompt 通胀的两个阶段叠加在一起,一个「高质量」的 AI 图像 prompt 可以轻轻松松吃掉 20 个质量修饰词。读起来像一份技术参数清单,不像一个能激发灵感的描述。

我有时候觉得,这大概是 AI 图像生成历史上最大的一个笑话——所有人在用完全相同的 20 个词,来证明自己的图比别人好。

转折点:当「电影感」开始毁掉你的图

2025 年下半年,风向开始变了。

越来越多的用户发现,加了「cinematic lighting」的图,有时候反而不如不加。加了「film grain」的人像,皮肤上多了一层莫名其妙的大颗粒噪点。加了「anamorphic lens」的风景,莫名其妙多了一条水平蓝光——就是那种迈克尔·贝电影里的镜头炫光,好看是好看,但不是每一张图都需要。

为什么?

因为「cinematic」这个词在训练数据里关联的不只是「好看的电影画面」,而是所有被标注为「cinematic」的图片的物理特征。好莱坞电影里有胶片颗粒吗?有。有镜头炫光吗?有。有暗角吗?有。有低对比度的阴影吗?有。

所以你写「cinematic」,AI 给你的不只是电影感,是电影的全部物理副作用。

「人类想要的是电影的气质。AI 给出的是电影的物理现象。」

到了 2026 年,这个现象更极端了。Midjourney V7、V8,Flux 2,GPT Image 2——这代模型的默认审美已经好到,你加不加「cinematic lighting」,出来的光都是戏剧化的。你加不加「shallow depth of field」,背景该虚化的地方就是虚的。

那些曾经让画面从「能看」变成「好看」的魔法词,现在变成了噪音。它们不是让画面更好看,而是让 prompt 更臃肿。甚至在某些情况下,它们还在拖后腿——比如「film grain」会让 Flux 2 的完美皮肤上多一层假噪点,「anamorphic lens」会在你的产品图上加一条毫无意义的蓝光。

我们自己的趋势数据也验证了这一点。在最近 30 天的 X 推文追踪中,「cinematic」这个词的日均提及量从 5-10 次直接掉到了 0-2 次。不是「电影感」不流行了——而是创作者发现,加不加这个词,出图效果已经没区别了。

prompt 通缩,正式开始了。

那现在该用什么

我不是在说所有修饰词都没用了。我说的是——那些「模糊的质量赞美」没用了。「4K」没用,因为模型输出的默认分辨率已经是 4K 了。「masterpiece」没用,因为它已经内化到了模型的审美引擎里。「cinematic lighting」没用,因为不用你说,模型也会给你最好的光。

但「具体的决策」永远有用。

「deep shadows in the corners, single light source」——这是具体的。它在告诉模型一件事:阴影在哪里,光源怎么打。

「sharp focus on the eyes, soft background」——这是具体的。它在告诉模型一件事:眼睛要锐利,背景不要抢戏。

「fine skin texture, visible fabric weave」——这是具体的。它在告诉模型一件事:拍特写,距离近到能看见布料的纹理。

「warm neon reflections on wet ground」——这是具体的。它在告诉模型一件事:场景里有什么,地面是湿的,光是怎么反射的。

看到了吗。

如果你把 2023 年的 prompt 里那 17 个质量修饰词删掉,换成 3 个具体的视觉指令——你得到的图会更好。不是因为字数少了,是因为信息量大了。

prompt 的本质不是咒语,是说明书。说明书越长不等于越精确。把每一寸空间用来描述「你要什么」,别用来描述「你要多好」。

更深的隐喻

写到这,我突然想起一个事。

2023 年的时候,有一个很火的 meme 叫「Midjourney cheat sheet」。就是那种一张长图,上面列了 300 个关键词,分成「光照」「色彩」「画质」「构图」「材质」「风格」十几类。小红书、知乎、B 站,到处都是这个图的变体。每个人都在收藏,每个人都在试图记住更多的「魔法词」。

那种感觉,怎么说呢。特别像一个刚学做菜的人,把所有的调料瓶子都排成一排,每道菜都挨个洒一遍——盐、糖、酱油、醋、五香粉、孜然粉、花椒油。不是因为你尝过之后觉得需要加,而是因为「别人说加了更好吃」。

2025 年之后,那个 cheat sheet 就没人发了。

不是因为它错了。是因为模型自己学会了放调料。而且放得比你精准。

你知道这像什么吗。

像手机摄影。

2015 年之前,手机拍照还需要你手动调白平衡、选对焦点、控制曝光补偿。稍微复杂一点的光线环境,你就能拍出一张惨不忍睹的照片。那时候,「会拍照」是一种可以炫耀的技能。后来 iPhone 的计算摄影和 Android 的 HDR+ 来了——你按下快门,手机自动做完了所有的白平衡、曝光合成、降噪、锐化。你不需要知道这些,你只需要构图。

AI 图像生成正在经历一模一样的事。

2023 年,你需要知道 20 个质量词才能让模型给你一张能看的图。2024 年,你只需要 5 个。2025 年,你什么都不加,出来的图已经是顶级画质了。

当画质不再需要被「命令」出来的时候,剩下的纯是创意。

这才是 AI 图像真正好玩的时代的开始。不是因为它终于能画得像照片了——Flux 早就能了——而是因为画质这个维度已经被默认填满了,所有人的差距被拉平了,竞争的维度从「谁画得更真」变成了「谁想得更远」。

Prompt 通胀结束了。

Prompt 的青春期,刚刚开始。


2023 年,所有人都在 copy-paste 同一行 prompt:「masterpiece, best quality, 8K, highly detailed」。

2026 年,这一行可以删掉了。

不是因为你的图不需要高质量。是因为「高质量」已经不需要你专门说出口了。

画质自由了。接下来,拼的是想象力。

tao

admin