阿里又发了个专门念念的大模子——宝贝好色
QVQ-Max,初版视觉推理模子,对苟且图像或视频都不错进行深度念念考。
举个道理的例子,上传一张你的手掌,再点击Thinking,QVQ-Max 就不错给你看手相:
不错看到,在深度念念考事后,QVQ-Max 就开动缓缓分析手掌上的线条和其他特征。
包括心线、头线、生命线等主要线条的分析,以及适度手指上的金适度的记号真义。
这还只是一个相比有文娱性的例子。
如果你连络给 QVQ-Max "喂"多张图片,它也不错进行深度念念考:
这两张图片描绘了哪些征象?它们之间的关系是什么?
在一顿念念考事后,QVQ-Max 准确地识别出两张图计划——都是西湖的征象,但一张是春夏时节,另一张是冬季。
再如数学推理,相同是给它"喂"一张图即可,连发问都省了:
在念念考之后,QVQ-Max 是找到了数字们之间的限定,并最终给出了正确谜底:10。
以及平直上传一个手绘简笔画视频,并附上一句:
分析视频,将视觉施行与笔墨并吞,并为视频中的镜头创建活泼道理的字幕。
最终,QVQ-Max 依旧是稳稳地完成了任务。
网友们看罢,亦然麻溜地去试了试。
不外这一次,QVQ-Max 有点小翻车——路飞是认对了,但这个乔巴……
以及啊,这两天被 OpenAI GPT-4o 图像生成带火的吉卜力,网友们亦然跟上了:
那么 QVQ-Max 的图像视频深度念念考实力到底如何,咱们这就亲手尝试一番。
实测 QVQ-Max
最初宝贝好色,咱们已经来测试一下 QVQ-Max 看图解数学题的才气。
题目是这么的:
然后咱们发问:
这谈题的谜底是若干?
在深度念念考事后,QVQ-Max 不仅精确识别出了手写的题目,何况给出了正确谜底:2。
巨乳gif刚才 Qwen 官方给出了看手相的例子,此次咱们再来"喂"下这张图:
问题是这么的:
这是什么?
嗯,是相比全面地先容了星盘。
接下来,咱们再来测试一下视频推理,例子就用 Anthropic 最新发布的一个:
如果刨去视频里的布景音,单是看施行,已经相比空洞的。
对此,QVQ-Max 给出的通晓是:
从不雅察到推理
除了成果以外,固然 Qwen 团队莫得公布关系论文,但关于背后的本事亮点,团队已经浅易的先容了一番。
最初,团队在 MathVision 这个 benchmark(集合各样繁难多模态数学)上进行了一番测试:
限定标明,通过疗养模子 thinking 的最大长度,模子在 MathVision 上的准确率也会捏续提高。
除此以外,团队还转头了 QVQ-Max 的三大才气特质。
包括对图片的瓦解才气十分强,不管是复杂的图表已经平常糊口中唾手拍的像片,它都能快速识别出重要元素。比如,它不错告诉你一张像片里有哪些物品、有什么笔墨标志,以致还能指出一些你可能忽略的小细节。
只是识别出图片里的施行还不够,QVQ-Max 还能进一步分析这些信息,并并吞布景学问得出论断。
举例,在一谈几何题中,它不错字据题目附带的图形推导出谜底;在一段视频里,它能字据画面施行忖度出接下来可能发生的情节。
除了分析和推理,QVQ-Max 还能作念一些道理的事情,比如帮你缠绵插画、生成短视频剧本,以致字据你的需求创作变装扮演的施行。
如果你上传一幅草稿,它可能会帮你完善成一幅完好意思的作品;上传一个平常像片,它不错化身机敏的批驳家,占卜师。
值得防护的是,QVQ-Max 是免费可用的哦,感酷好的一又友快去试试吧 ~
体验地址:
https://chat.qwen.ai
参考并吞:
[ 1 ] https://qwenlm.github.io/zh/blog/qvq-max-preview/
[ 2 ] https://x.com/Alibaba_Qwen/status/1905342260100956210
一键三连「点赞」「转发」「留心心」
接待在批驳区留住你的方针!
— 完 —
速抢席位!中国 AIGC 产业峰会不雅众报名通谈已开启 � � ♀️
首批嘉宾曝光啦 � � 百度、无问芯穹、数势科技、生数科技、像素开放等十数位 AI 范畴创变者将皆聚峰会,让更多东谈主用上 AI、用好 AI,与 AI 一同加快成长~
4 月 16 日,就在北京,全部来深度求索 AI 怎么用 � �
� � 一键星标 � �
科技前沿发扬逐日见宝贝好色