科创科普:AI 是怎么「画」出一只猫的?——文生图与扩散模型入门

科创科普:AI 是怎么「画」出一只猫的?——文生图与扩散模型的入门原理

一、先纠正一个误会:AI 画画不是「从图库里翻图」

很多同学以为,输入"一只戴帽子的橘猫"就能出图,是因为 AI 在图库里检索到了相似照片。事实并非如此。像常见的文生图模型,出图时并没有一张现成的橘猫照片被复制出来,它是从一团随机噪点开始,一步步"擦"出一张全新的图。也正因为它不是在拼接已有照片,所以才会出现"六根手指""三条腿"这类现实中不存在的画面。

二、三步看懂文生图:文字变向量、加噪去噪、图文对齐

第一步,文字变成数字。你输入的提示词会被一个文本编码器切分成词片段,每个片段变成一个几百维的数字向量,整句话就成了一条数学意义上的"意思坐标"。模型后续所有工作都在这条坐标的引导下完成。

第二步,从噪声到图像。训练阶段,模型反复看"一张干净图片+随机噪点",学习如何把噪点"减去",还原因片;训练够多之后,给它一团全新的纯随机噪点,并告诉它"目标是戴帽子的橘猫",它就能一格一格地反向预测、逐步去噪,几十步之后噪点被磨成一张清晰图。这类方法通常叫扩散模型,特点是出图慢但画面细腻;也有把多步压缩成一两步的加速版本,代价是细节略逊。

第三步,图文对齐。让"文字的意思是猫"和"画出来的确实像猫"对应起来,靠的是对比学习:把配对的图文拉近、不配对的推远。经过大量这种训练,模型才建立起"帽子""橘色""猫"这些词与视觉特征的对应关系。这就是为什么换一个词,出来的画面会真的跟着变。

三、提示词不是越短越好:四要素写清楚

第一,主体要具体:不要写"一只动物",写"一只戴红帽子的橘色短毛猫"。第二,场景要交代:室内窗台、雪地、操场看台,画面立刻不同。第三,风格和视角要指定:水彩、扁平插画、写实照片,正面平视还是俯拍。第四,画幅与用途:竖版海报还是横版封面,留白位置在哪。

还要留意两点:一是同一条提示词每次结果都不同,这是随机种子在起作用,想复现就要固定种子;二是模型只对训练中见过的概念比较擅长,生僻的方言、冷门历史场景容易失真,需要多次生成再挑选。

四、这些图和文字是真的吗?学会两问

第一问:这张图是什么模型、什么时间生成的?正规平台的 AI 图片会带有生成标识或水印。第二问:图里的信息我能在可靠来源上交叉印证吗?尤其在科学、历史、新闻类作业里,AI 生成的图只能当"示意",不能当"证据"。用 AI 帮忙构思可以,把 AI 生成的内容当成事实依据就错了。

案例:给校运会做一张宣传海报图

一位同学需要为校运会设计海报配图。他的第一次提示词只有三个字"校运会",结果出来的图既没有人也没有跑道,只有模糊的运动鞋。第二次他补齐了四要素:"一群身穿蓝色校服的中学生在红色塑胶跑道上冲刺,竖版海报构图,右上角大面积留白放标题,明亮写实风格,晴朗白天"。这一版的构图就能直接用于排版。他的体会是:写提示词像给设计师写需求单,信息写清楚,废片的比例就大幅下降。

练习

  1. 用一句话解释为什么 AI 生成的图可能出现现实中不存在的手指数量。
  2. 把"图书馆"这三个字扩写成一条包含主体、场景、风格、画幅四要素的提示词。
  3. 判断下列做法对不对并说明理由:把 AI 生成的一张"恐龙照片"直接放进生物课作业,注明"来自互联网"。