AI 绘画与扩散模型

AI工坊 · 应用技术 · 约 4 分钟阅读

输入"一只戴着宇航头盔的猫,赛博朋克风格",几秒后就能得到一张精美图片。Midjourney、Stable Diffusion 等工具背后的核心技术叫扩散模型(Diffusion Model)。

从噪声中"雕"出图像

训练时:给清晰图片逐步加噪点,直到变成一片雪花噪点,让模型学会这个"破坏"过程的逆过程。
生成时:从一片纯随机噪点出发,模型根据你的文字描述,一步步去除噪点——先出现大致轮廓和配色,再逐步显出结构、细节、纹理,最终得到清晰图像。

文字怎么控制画面

模型在训练中把图片和对应描述关联起来。生成时,文本提示词(prompt)引导"去噪"的方向:每一步都朝"既像猫、又像宇航员、又有赛博朋克光影"的图像空间靠拢。提示词越具体,画面越可控。

同样的思想不止于画图

扩散模型也被用于视频生成、音频生成、3D 建模、医学图像修复等领域。它已成为当今生成式 AI 最重要的技术路线之一。

← 返回首页