Wink Pings

Gemini 2.5 Flash:当图像生成开始「看见」自己

Deepmind研究员揭秘新一代原生图像生成模型如何实现多模态协同进化,以及为什么文本渲染能力会成为关键突破点。

Deepmind负责Nano Banana的模型研究员最近在播客里拆解了Gemini 2.5 Flash的技术内核,这个号称「原生图像生成」的模型确实有些反常识的设计。

最核心的变化在于,它把图像生成、理解和编辑打包塞进了同一个多模态上下文。简单说就是模型在连续出图时,每一步都能「看见」自己之前生成的图像和文本——就像画家会不断审视画布调整笔触,而不是闭着眼睛连画十张风格各异的草图。这种设计让「保持一致性」从后期修图需求变成了底层能力。

团队把图像理解与生成比作「姐妹」,这个比喻意外地准确。传统做法像让两个陌生人背对背传话,而他们通过统一训练目标,硬是把这对姐妹培养出了心电感应——理解能力提升会带动生成质量,生成数据反哺又能优化理解精度。

有意思的是对「文本渲染」的执着。现在多数团队还在用人类标注数据当裁判,但Deepmind显然受够了这种又贵又慢还带主观色彩的评估方式。他们试图让模型自己建立审美标准,这招要是真能跑通,说不定能终结「甲方审美」的世纪难题。

至于未来方向,研究员提到两个关键词:「聪明感」和「靠谱」。前者要求模型能自动补全用户潦草的指令(比如把「画只猫」脑补成「布偶猫在窗台晒太阳」),后者则要解决AI绘图祖传的「六根手指」这类硬伤。

播客链接在最后,建议开二倍速——这些搞模型的人说起话来,语速总比他们的迭代速度慢三拍。

![CardImage](https://wink.run/image?url=https%3A%2F%2Fpbs.twimg.com%2Fcard_img%2F1960559792126345216%2FmfCnAyBx%3Fformat%3Djpg%26name%3Dlarge)

完整内容:https://www.youtube.com/watch?v=H6ZXujE1qBA

发布时间: 2025-08-28 17:45