输入"一只戴着宇航头盔的猫,赛博朋克风格",几秒后就能得到一张精美图片。Midjourney、Stable Diffusion 等工具背后的核心技术叫扩散模型(Diffusion Model)。
模型在训练中把图片和对应描述关联起来。生成时,文本提示词(prompt)引导"去噪"的方向:每一步都朝"既像猫、又像宇航员、又有赛博朋克光影"的图像空间靠拢。提示词越具体,画面越可控。
扩散模型也被用于视频生成、音频生成、3D 建模、医学图像修复等领域。它已成为当今生成式 AI 最重要的技术路线之一。
← 返回首页