Midjourney V6刷屏,但它最可怕的地方居然不是那些神图? mid journey midjourney v6
admin
2023-12-24 14:18:36
0


Midjourney在沉寂九个月后推出了Midjourney V6,这个文生图产品体现出的更细腻的细节处理,更强大的语言理解能力和更加“不像AI”的图片效果在过去几天引发一片惊呼。

作为一个闭源的模型产品,Midjourney的魔法配方并不为人所知,但就像OpenAI和Google一样它会在产品更新时发布官方技术公告,有心人还是可以从中一窥模型能力提升的技术原理。

而我们去扒了扒它透露的信息后,发现这次更新的意义远不止于大家晒的那一张张精美的图片上…….


Midjourney v6生成,电影月光光心慌慌的假剧照,图片源自reddit

图片模型的突破,却靠的是语言模型能力?

“Midjourney v6作为一个“文生图”模型,此次改进的核心能力却来自其自然语言处理能力的提升。

这首先是对提示词理解的’跟随能力’的提升。在其官方文档中,这被称为“prompt following”。简单来说,这就是指系统对用户输入的提示词的理解和响应能力。通过增强这一能力,Midjourney现在能够更好地解析复杂的提示,无论是关键词、命令还是问题,都能够准确把握。


Midjourney v6生成,电影疤面煞星的假剧照,图片源自reddit

第二个显著的更新是提示词的长度。用户现在可以输入更长的提示词。这一方面得益于上面提到的模型跟踪能力的增强,另外则依靠模型连贯性的提升。

所谓连贯性,用一个经典的故事就能解释。A问B:“下午大扫除,你来吗?”B说:“我去!我不去!”那么B的意思毫无疑问是不去,因为上文中的大扫除非常累,而B说的“我去!”在这里则表示惊讶,能够准确理解这个对话,就叫连贯性。它确保了模型在处理用户哪怕很复杂的指令输入时,也能够逻辑一致地响应。


Midjourney v6生成,李奥纳多在网飞出演电视剧的海报,图片源自reddit

这两个自然语言能力上的改进,Midjourney具体是如何做的?

在跟随能力方面的改进,主要基于三个方面:

上下文管理,它通过分析上下文关系来更准确地理解用户意图;序列建模,利用循环神经网络(RNN)和长短时记忆网络(LSTM)来捕捉对话中的长期依赖;以及交互状态跟踪,它持续追踪用户的目标、意图和对话状态,以确保系统响应的连贯性。

这些改进看起来就像是一个大语言模型的进化中在做的事情。


Midjourney v6生成,圣诞夜惊魂版的小丑和哈莉奎茵,图片源自reddit

但它毕竟是个文生图模型,也就是语言能力和图片能力结合的模型,这其实也给它在提升能力时带来了优势——与语言模型的对话产品形态总是涉及隐私与所属的问题不同,Midjourney v6生成的图片目前来看,全部是公共资源。

也就是说你花钱买了服务以后,图片是公共的,模型会生成两份,你拿一份,V6的服务器(也就是V6 discoard)也拿一份。那么Midjouney可以拿这些“实战”反过来加入到自己的预训练大模型中,继续训练模型以提高性能。


Midjourney v6生成,一只猫拿着手枪,图片源自reddit

所以这还引出一个有意思的话题,如果文生图因此而能够源源不断拥有更高质量的数据来反哺到预训练阶段,而数据真的成为模型训练的决定性因素后,是不是文生图模型有可能训练出比大语言模型更强的语言能力?

在连贯性提升上其实就已经有一点这个味道。对于大语言模型来说,想要提高连贯性并不简单,涉及了多方面的因素。但是作为一个使用自然语言来生成图片的模型,事实上简化了过程,由于它不涉及与用户进行持续对话,因此无需应用束搜索等启发式算法,也无需处理自然语言生成中的后处理问题,如语法校正和风格调整。这种简化使得Midjourney在提高连贯性方面只需专注于核心任务,从而显著提升了其在理解和响应用户输入时的逻辑一致性。


Midjourney v6生成,猎魔人杰洛特与超人的结合,二者皆有同一演员亨利·卡维尔饰演,图片源自reddit

懂视觉的模型能有更好的文字能力?

图像模型却靠语言能力突破,这其实已经不是第一次。此前同样引发一阵骚动的Dalle3,也是如此。作为OpenAI的模型,背靠ChatGPT,语言能力自然更强。

在对比了两者后我发现V6在语言理解上其实还是较DALL·E有一定差距。最明显的地方就在于适应性上。适应性代表系统在能适应不同用户的语言风格和表达方式,以及在面对新的或未见过的情况时保持响应连贯性的能力。可能是DALL·E背靠ChatGPT,所以在对自然语言各方面的性能上会更优异一些。

但Midjourney似乎也在瞄着ChatGPT为代表的语言模型的能力来进化。在此次的更新中,V6增加的另一个非常重要的能力,也与语言有关。Midjourney称,其现在拥有了文本绘制能力,虽然依然较弱。

对于人工智能绘图来说,能绘制文本无疑是一项重大进步。


文字不再是乱码。图源:X.com

这个能力并非像看起来那样,直接来自模型里大语言模型的模块。在官方更新里,文本绘制能力后紧随的是图像放大功能的更新。它们原理比较复杂,但本质其实是同一个问题。

图像生成模型在训练的时候所用的数据,是一些通过泛化和模糊处理的图像内容。我们都知道,分辨率越高的图片数据量越大,反之,越模糊越泛化的图片它的数据量就越小。人工智能理解图片的方式和人类完全不一样,他们是按照统计学的一个概念叫做“模式识别”,通过图片中的特征来理解。使用泛化和模糊的图片好处在于,小数据量的图片读取速度快,训练时间就短。但想要用这种训练方式来理解文字是非常难的,因为文字是一种符号,这种泛化处理对于图像中的文字尤其不利,即使是微小的变形或模糊都可能导致文字难以辨认。同时,训练所使用的图像分辨率很低,那么生成图片时,分辨率也不会高到哪里去。


图片上的文字与图像整体风格融合。图片来源:X.com

而Midjourney的训练方法,其实就是在训练它的图像“放大”能力。它所使用的模型叫做去噪扩散概率模型(denoising diffusion probabilistic models),这种模型通过模拟从噪声中提取信息的过程来生成清晰的图像。想象一下,就像我们用软件修复模糊的老照片,Midjourney的模型也能够从模糊的图像中“学习”到清晰的细节。


图片来源:X.com

也就是说,这是像Midjourney这样的图像模型一直在做的事情,训练越久优化越久它的图像“放大”能力就越强,也就会逐渐产生关于文字的生成能力。

在直觉上,这种能力肯定不如“纯粹”的语言模型的语言能力,但一些研究已经在给出不同的指向,在多模态领域很重要的模型VLMO的论文里就曾提到一个有意思的结论,当你完全拿一个在视觉数据上训练好的模型,可以直接对文本数据建模,甚至不需要微调就可以有很强的文本生成能力。但反过来用语言训练在视觉上生成,则差很多。


这也许就是视觉想对文字说的话。图源:X.com

这是一种很奇怪也很有意思的现象,这一次V6似乎把它再一次轻微的展示出来了。而更重要的是在今天多模态大模型已经成为未来最重要的趋势时,一个图像能力为主的模型产生文字能力给了走向多模态一个新的思路。

世界更精彩了。



欢迎加入这个星球,见证硅基时代发展↓

相关内容

热门资讯

探索消费信贷与社交支付深度融合... 腾讯这一金融产品再添新功能,4月19日,北京商报记者注意到,微信分付灰度测试转账功能引发热议,在向微...
土耳其主要银行股指早盘下跌2% 每经AI快讯,4月20日,土耳其主要银行股指早盘下跌2%。 每日经济新闻
好用的OTA代运营源头厂家 在如今竞争激烈的酒旅行业中,OTA代运营服务成为了众多酒店、民宿提升竞争力的关键。但市场上的代运营厂...
成都五一出游全国热门第三 “五一”假期临近,同程旅行最新发布的《2026“五一”旅行趋势报告》显示,今年“五一”期间成都同时位...
俞浩:追觅希望成为人类有史以来... 追觅创始人兼 CEO 俞浩今天接受晚点 LatePost 访问,谈自己为何“疯狂”。 俞浩表示,他其...
原创 6... 60万工人的选择 根据中国新闻周刊的统计数据,从2020年1月到7月,仅短短半年的时间,我国的外...
监管重磅!虚拟货币全是骗局!这... 近日,官方召开打击虚拟货币交易炒作工作协调机制会议,再次明确表态:虚拟货币不是法定货币,不具有与法定...
腾讯公司与浙江大学达成深度合作... 当互动娱乐不再只是日常消遣,当高校科研走出象牙塔,一场关乎数字科技未来的深度携手正悄然改写行业格局。...
1分钟,垂直涨停!A股两大板块... 今日早盘,A股整体震荡上扬,创业板指盘中再创11年新高,深证成指亦再创4年新高,上证指数、科创综指、...
原创 预... 最近各大气象机构的报告密集更新,信号已经非常明确了。2026年下半年,厄尔尼诺大概率要来,而且来势不...
菲亚兰德由创始人夫妇控股近95... 瑞财经 吴文婷4月17日,深圳菲亚兰德科技集团股份有限公司(以下简称“菲亚兰德”)在港交所递交招股书...
突发:5吨黄金+8吨白银滞留海... 王爷说财经讯:突然出手!印度开始卡黄金进口了!到底发生了什么? 2026年4月20日,据路透社17 ...
茅台净利润暴跌!24年首次双降... 商业润点 |Biz Run Review 2025年4月16日晚,贵州茅台发布年报:营收1688...
机构预测明晚油价将迎年内首降,... 4月21日24时(即本周三零点),国内成品油调价窗口将再度开启。多家行业机构预测,本轮调价大概率迎来...
增长10%!德国葡萄酒在中国做... 近年来,中国葡萄酒市场持续收缩,但德国葡萄酒却在这一萎缩的市场中,走出了一条逆势上扬的曲线。 202...
「一城一酒」百元档意外扛大旗,... 本报(chinatimes.net.cn)记者周梦婷 北京报道 在白酒行业仍处低谷的大行情下,“西北...
两部门发文加大进出口信贷支持力... 商务部、中国进出口银行近日印发《关于强化进出口信贷支持 服务“十五五”商务高质量发展良好开局的通知》...
原创 炸... 今天聊一个让整个东亚棋局都为之一震的事儿——中国钨出口管制,直接把日本打了个措手不及。 很多朋友可能...
高盛:母猪去化11%,猪价后续... 2026年4月,高盛发布最新研报指出,中国生猪行业已触达周期底部,虽当前价格承压,但供需反转在即。数...
超3400只个股飘红,沪指、深... 20日,A股三大指数开盘涨跌不一,随后集体翻红,午后创业板指翻绿。Wind数据显示,截至收盘,上证指...