ARTICLE READING
画面里的文字为什么总是乱:先问这张图要不要字
画面里的字乱,很多时候问题不在「写不好」,而在这张图要不要字没想清楚。翻一批实测素材的提示词,看这件事落在哪四个地方。
先看半句话。
城市夜景那一册里有一张《河岸夜市》,临河摊位、蒸汽、灯笼、玻璃幕墙的倒影。它的叙事线索那一栏原文写着:「蒸汽遮住半个招牌但没有文字」。
招牌被蒸汽遮住一半,是刻意安排的。后面那五个字才是重点——这套素材对文字的态度,是让字干脆不要出现。
七十张图里,和文字有关的指令有四处
翻这批素材的提示词记录,会看到四处在做同一件事。
负面清单最靠前的两个词是 `text` 和 `readable signage`。这份清单一共十三条,七十张共用同一份,从水印、签名、低分辨率、模糊一路写到卡通、塑料质感、过饱和霓虹。
约束那一栏七十张一字不差:`no text, no logo, no watermark, no signature, no readable signage, avoid duplicated composition from other batch items`。七十张里,七十张都写了不许有字。
构图那一栏七十张各有各的写法,一共出现六十五种,但每一种后面都缀着同一句 `no text area required`——不需要给文字留位置。
第四处在「关键调整」里,同样是七十张共用的三句话,第二句是:「生成后如主体不清晰,增强视觉锚点但不要加入文字」。
四处讲的是同一件事:这套图的默认做法,是让文字不出现。
你看到的「乱」,多数是没排干净
文字没被彻底排除的时候,模型给出的往往不是空白,而是「看着像字」的图案:远看有笔画的疏密和节奏,凑近看一个都不成立。这种情况在缩略尺寸下最难发现,因为它小到刚好能骗过眼睛。
第四批那四十五张的交付检查项里,专门有一条在盯这件事。单张的质检记录写着「未见文字、水印或拼图」——成图之后还要复查一遍,确认没有漏进来的。
要排干净,三个地方得同时写。
负面清单把这一类词一次写全:`text`、`letters`、`numbers`、`logos`、`watermark`、`signature`、`readable signage`。零零散散加两三个不够,剩下的会被补上。
构图那一栏补一句不需要给字留位置。这一句管的是构图,负面清单碰不到它——它告诉模型这块画布不必为一段文字让出空间。
然后是复查。缩到列表里显示的大小看一眼,比放大盯着原图更有效。
需要字的时候,负面词帮不上忙
负面词只能减,不能加。它可以压低「文字」这个特征的权重,但没办法指定画面上出现哪四个字。
所以招牌、包装、海报、书籍封面、界面截图这类必须有字的场景,指望一次生成到位不现实。这批素材恰好没有这个需求——它们的用途在提示词第一行就写死了:网站视觉素材。
真需要字,稳妥的做法是把位置留空,字后期贴。留空这件事也要在提示词里说清楚。写「不要字」,模型可能把整个区域跟着一起糊掉;写「这块区域保持干净、不要有任何内容和纹理」,出来的结果不一样。
另一个容易忽略的点:笔画越多、结构越密,越难成立。拉丁字母里三四个字母的短词偶尔能出对,中文字形复杂得多。这属于任务难度不同,跟模型好坏关系不大,所以别指望同一个方案在两种文字上表现一致。
主体不清的时候,别用字去补
「关键调整」里那第二句话值得单独拎出来:主体不清晰时,动作是增强视觉锚点,不要加入文字。
这一步很容易走反。画面看着空、看着弱,人的第一反应是压一行字上去——标题、注释、一句短文案,画面立刻「有东西了」。但这个「有东西」是拿读者的注意力换来的,它盖住的是结构缺陷,并没有把结构修好。
该做的是把主体做大、做亮,或者把周围压下去。留白该留多少、主体该占多大,构图就三个动作 里拆过。如果连主体那一格都写得含糊,先顺一遍提示词的结构,问题常常不在文字上。
出图前先问一句话
就一句:这张图要不要字。
不要,上面那串词一次写全,构图那栏补上不需要留位置,出图后缩到列表尺寸复查一遍。
要,就别在生成阶段硬扛,留一块干净的位置,把字放到后期。
另外,城市夜景 那一册里,招牌、霓虹、橱窗的场景不少,但画面里一块字都没有。《河岸夜市》是拿蒸汽遮的,《旧城雨巷》里那块木招牌也是空的。东方未来那一册的月港牌楼 更直接——整座牌楼的造型都在,唯独没有匾额。翻一遍就知道这个策略执行到了什么程度。