刚刚,阿里Qwen3.8-Max来了

2026-08-03 07:25:31 · chineseheadlinenews.com · 来源: 量子位

不er?你告诉我现在搁哪儿还有便宜还好用的模型啊……(真心发问.jpg)

说时迟那时快,友友们,这不就来了嘛!!!

就在刚刚,阿里巴巴突袭发布新一代基座大模型Qwen3.8-Max。

用四个字概括就是:“能打”“便宜”。

总参数量达到2.4万亿,在编程、专业工作、长程任务、多模态智能体等场景上的表现直接next level。

就在今天最新放榜的权威第三方榜单Arena中,Qwen3.8-Max更是一路冲到全球大模型第一梯队,表现直逼Anthropic的Claude系列模型:

△Text Arena文本能力榜单,包含数学、代码、创业写作等领域

在编程表现上,Qwen3.8-Max甚至还超过了Claude Opus 5和Fable 5的High版本,确实有亿点不简单???

△编程能力(前端)榜单,考察多步骤推理及工具调用的编程智能体能力等

性能能打是一方面,关键是吧,人家连价格也一块打了下来——

国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,输入与输出的国际价格仅为Opus5的40%与24%……真·便宜大碗。

性价比高,能力还强,那还了得?

瞧嘛,此前抢先体验Qwen3.8-Max预览版的网友,已经火速交上第一批实!测!反!馈!

看下面这位老哥,直接用Qwen3.8-Max复刻了一版《愤怒的小鸟》,直言价格很合适,一周使用下来额度消耗不到九成,赞!

还有网友只用一条提示词,就用Qwen3.8-Max搭出了一个完整、可交互的开发者作品集,最后给出的评价也相当言简意赅:《夯》!

哦对了,还有一堆网友们,已经针对模型“超能打”的表现开始聊得火热朝天了!

下面这位友友表示,已经迫不及待想把Qwen3.8-Max用起来了,顺便还不忘祝A社、O社IPO好运~(夺笋啊)

下面这位网友还提到,Qwen3.8-Max基准测试都把5.6-Sol给KO了,大家对A社和OpenAI的期待恐怕也得跟着变——

毕竟又贵又闭源,门槛确实摆在那儿......

还有朋友实测后感慨,Qwen3.8-Max的表现甚至超过了Fable 5,这波能力属实有点超出预期了奥!

真·有口皆碑了也是。

既然,Qwen3.8-Max来都来了,我们也直接实测一波,看看模型到底能不能打!

编程、专业工作、长程任务、多模态分析统统梭哈!

说实话,阿里Qwen的前几代模型我几乎是发了一个测一个,零零散散测下来,最大的感受就是——

确实夯,也确实能打……

而这次到了Qwen3.8-Max,感觉又不一样了,因为面对真实世界里的复杂问题,这模型已经能一路拆解、执行,直到交付最终成果了。

在具体评测表现中,Qwen3.8-Max在科研复现、多模态理解、长视频和电脑操作多项超越GPT-5.6、Opus 4.8与Fable 5,在编程、终端Agent和专业工作也稳居行业头部——

贴心的我,也帮大家浅浅总结了一下Qwen3.8-Max的亮点能力,让大家一睹为快!

编程能力:能把复杂任务端到端地自主交付,理解需求、搭建工程、运行实验、检查结果、继续优化全流程梭哈。官方披露的一个极端案例是,它能从一个空文件夹出发、在无人干预下自主推进十多天,最终交付一个真实可用的完整项目。

长线程任务:具备系统级自主规划与执行能力,在数千轮超长程交互里也不迷失目标。

专业工作:能一次交付需要返修3到5轮的APP原型,也能在一小时内处理数百份法律文档,完成上千个条款标注。

多模态智能体:几百页的复杂材料、上百小时的视频内容都能消化,还能顺手整理成直接可用的成果。

我:如此之能干,如此之务实,还有这好事儿?那我可就直接狠狠一个大测特测!!!

Vibe一下,编程能力大考验

既然,Qwen3.8-Max如此擅长AI Coding,那我们直接上来就考察一下这模型的“编程本事”。

好巧不巧的是,最近的我正愁每周例会上该怎么把这一周的AI热点捋清楚,做成一份能给领导交差的分享。

这下好了,我索性把这事儿交给Qwen3.8-Max~(鬼点子生成中)

不过,光用一句提示词搭个网页,多少有点太简单了,于是乎——

我直接化身产品经理,喂给了Qwen3.8-Max整整一大页产品需求,让它“从零”开发一个可运行的AI资讯网页。

在具体需求上,我不仅明确要求了网页需要具备的核心功能,还对数据、页面体验、技术约束、验收标准、交付要求进行了明确约束,主打一个狠狠刁难!!!

大概过了5分钟。

我的这位产品经理Qwen3.8-Max,就直接给我端上来了一份接近正式产品交付水准的全链路解决成果——

整个交付过程页面我从头拉到尾,说实话,确实有点让我震惊。

需求拆解、技术选型、项目结构、功能实现,该有的环节一个没落,完全是一套真实项目从开发到交付的完整流程。

然后,我再定眼一看,发现Qwen3.8-Max还专门整理了一份“问题与解决记录”,开发过程中碰到了什么报错、问题出在哪儿、最后怎么修好的,它全给列得明明白白。

而作为提出需求的那个人,我真的全程一次手都没插,甚至直到看见这份记录,我才知道中间居然还冒出过这么多麻烦???

不是我说,这模型是真·有问题自己解决啊,Qwen3.8-Max:事情交给我您放心哈~

此外,在检查模型作业的过程中,我又发现了点我属实没料到的东西……

Qwen3.8-Max在交付前,还给整个项目来了一轮正儿八经的“功能验收”????

从安装依赖、本地启动,到生产构建和预览,它把项目能不能跑起来逐项过了一遍。

甚至,连数据量、分类覆盖范围、搜索清空后的页面恢复,它都一项项列进了验收清单,最后统一打上“通过”。

别说,整个从零搭建项目的全过程真有点真实工程内味儿了,be like:

真的就几分钟。

我写下的一整页产品需求,就这么被Qwen3.8-Max直接交付成了一个能跑的项目。

我忐忑地打开Qwen3.8-Max给我的代码跑了一下网页,没有报错,也没有哪项功能突然掉链子。

页面布局、资讯分类、搜索、排序、收藏……几乎和需求文档里写的一模一样,交互也没有问题,

原本可能需要我自己一轮轮试错、查报错、补功能、跑测试的工程过程,就这么全让模型一个人干了。

我只想说,Qwen3.8-Max,你这是真·端到端啊……

长长长长文本分析也来探一探

能搞定编程项目的全流程交付,确实不亿般。

But,在日常学习工作场景中,我们很多时候未必有那么多需要Coding的场合。

很多时候真正想让我们口吐芬芳的,反倒是一些《蛮基础》的工作场景,就比如啊——长文本分析。(doge)

估计有友友该说了,这有啥难的啊,直接喂给AI资料,然后坐享其成得了呗~

单纯的文本分析当然不难,but,让AI对几十页复杂文档进行“交叉分析”那事情就不一样了。

之前我就喂给过GPT一份包含几十页的技术文档,让AI总结内容还行,但涉及跨章节、细节对比的事儿就宕机了…

于是灵机一动的我,这回也给Qwen3.8-Max上点难度。

这次我喂给它的是AI大神卡帕西参与撰写的一篇几十页的论文,正文、图表、附录一个不少。

这篇论文复盘了2010—2014年ImageNet大赛,讲清楚AI看图能力是怎么一步步逼近人类的,以及这背后数据、算法和评测规则各自起了多大的作用。而我向AI发起的问题是:

论文拿ILSVRC和PASCAL VOC这两套“AI看图考卷”做了比较,结合正文、表3和附录B的图16来看,哪套题更难?为什么看平均值和看困难类别,会得到不同答案?

这个题难就难在,AI光搜关键词还真答不了,因为答案散落在正文、表格、图表和附录里,AI得把几组数据全部对上,并且进行交叉分析得出结论才行。

大概33秒的时间,Qwen3.8-Max就直接给了我一个明确答案——

只看整体平均值,PASCAL VOC似乎更难;但看可比类别和ILSVRC的困难子集,ILSVRC在很多方面并不比 PASCAL VOC简单,甚至更难。

为了确认这份回答是否准确,我又对照原文的表3、图16和附录B逐一定位,发现这AI确实说的是“对的”——

比如在原论文中,图16上排比较全部1000个ILSVRC类别,下排则筛出随机定位成功率最低的200个类别。

可以看到,进入困难子集后,ILSVRC在多项定位难度指标上确实已经接近或超过PASCAL,AI说的完全正确,哪怕是在几十页文档资料里对跨章节内容进行图标图片和文字的联合分析,也没难倒这个AI:

此外,Qwen3.8-Max为了告诉我它为什么得出这样的结论,还给我生成了一篇超有理有据的“分析报告”。

从物体大小、位置变化、定位难度、画面杂乱度几个维度对ILSVRC和PASCAL VOC两套考卷进行了分析。

哦对了,它还把原文中的表格直接1:1单拎出来作为证据,定位找得那叫个《稳准狠》……

我只能说,还在苦啃论文、资料文档的友友们,这下我们的好日子可能真的要来了。。。

多模态内容理解任务也安排上

上面两轮实测,说到底,考察的主要还是Qwen3.8-Max对文本的分析、理解和执行能力。

但我们的日常学习工作里,还有一块更难啃、也非常刚需的硬骨头场景:多模态内容分析。

对AI来说理解某一个画面或者总结一个视频内容确实不是难事儿。

真正麻烦的是,当素材被拉长到几十分钟甚至几小时,它还能不能理清其中的人物、事件和观点关系,并根据一个具体问题,精准定位到原片段。

于是这次,我直接把手头一个亟待处理的“实录烂摊子”交给了Qwen3.8-Max——

一期接近70分钟的视频播客,在播客里山姆·奥特曼从AI创业一路聊到OpenAI战略和未来社会,话题多、跨度大,想从头捋清楚并定位原片段,少说也得折腾半天。

△播客来源:“Relentless”Youtube账号

对此,我交代给Qwen3.8-Max的任务,也可以说非常复杂艰巨——

请为这期播客生成一份完整的主题时间轴,并按“话题观点”定位原始片段。

对于AI来说,这不仅要求它能准确识别人物、事件与观点之间的关联关系,还要能重建整期播客的叙事结构,并把每个观点精准映射回原始片段。

大概也就两三分钟,Qwen3.8-Max就给我吐出来了一份按照核心观点划分的播客内容。

更贴心的是,每个话题都采用“先总结、再展开”的结构,前面提炼核心观点,后面逐段捋清具体内容,还一一标出了对应的时间戳。

对我来说最大的好处嘛,那就是看到哪段感兴趣,直接点进原视频精准空降就行,简直不要太太太太方便!!!

好用是真的,用得起也是真的

哪怕AI Coding发展到今天,海外主流模型三天两头迭代得飞起。

我们依旧不得不承认一个事实:落到用户的实际体验里,似乎始终很难真正做到“既要、又要、还要”。

换句话说,模型能力、场景覆盖和价格,这三件事儿似乎总不能同时兼得。

Coding能力很能打,到了其他场景里,交付效果却未必同样稳定;就算效果足够好,价格也经常让人望而却步,各种Plan和Token费用,长期用下来确实烧不起。

但这次实测完Qwen3.8-Max,我可能得重新下一个结论,那就是全球头部模型——也是能用得爽,还用得起的。

每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,输入和输出价格真的只有Opus 5的40%和24%。

这意味着,大家不用承担高昂的Token费用,也能获得高性能模型带来的完整体验。

而在真实场景中,Qwen3.8-Max所完成的工作,也早已超出“生成”这一步。

它真的可以从零开始,帮我推进一项完整工程,再把过程中冒出来的实际问题一个个解决掉,最终把能运行、能检查的成果交到我手里。

△AI生成

这种兼顾,放眼整个模型圈里都算得上稀缺。

而Qwen之所以敢把能力、场景和价格一起next level,实际上背后靠的也远不止一款Max模型。

从2023年开源至今,阿里已经累计开源400多个模型,衍生模型已经超过20万个,累计下载量突破10亿次,一路下来,Qwen也成为了全球规模最大、覆盖最全的开源大模型家族。

更值得注意的是,Qwen这条更新进度条,过去一年几乎就没停过。

从Qwen3到Qwen3.5,再到如今的Qwen3.8,几乎每一次迭代,都对应着一批新场景真正变得可用——从基础推理,延伸到编程、专业工作、多模态理解、长程Agent,再到这次的端到端交付。

这种日拱一卒的节奏,放眼全球也没几家跟得上。

于是,我们或许真的可以下一个结论。

那就是真正“好用”的模型,未必一定昂贵;真正“便宜”的模型,也未必需要在能力上做取舍。

而Qwen3.8-Max,恰好把这两件事放在了一起。

对了。

目前,Qwen3.8的API已上线千问AI平台,还接入了阿里今日同步推出的Agent产品“千问办公”,感兴趣的朋友不妨直接上手试试~


    24小时新闻排行榜更多>>
  1. 不是AI图!中国干部受访照掀热议 疑患这罕见病
  2. 华商全家回国被关小黑屋 禁出境十年8千万资产归零
  3. 胡锦涛一家传言甚嚣尘上 凤凰卫视回应辟谣
  4. 福与祸之间:七种会改变命运的内在特质
  5. 政治局学习泄密 分析:习掌权14年未能搞定军队
  6. 纽约惊现3.65米巨鲨 疑核变怪物 检验结果出炉
  7. 重新认识五个词,阿根廷、网格员、洗衣机…
  8. 中国7月RatingDog制造业PMI连续八个月扩张
  9. 青岛仓库大火传被员工献忠 火焰黑烟爆燃场面骇人
  10. 多人因蝉鸣听力受损,医生紧急提醒
  11. 秦制两千年,看制度如何规训人性
  12. 涉及中国AI,两家英媒同日发文
  13. 俄军狂轰乌克兰酿9死!泽伦斯基绝望求援
  14. 中国如何监视在华外国人?
  15. 中国出入境新规为何让人如此惶恐?
  16. 法国强化敏感企业外资入股审查
  17. 中国歼-36战机首次曝光
  18. 东北三个省会,都失速了
  19. 中国亮剑:不会任由谁在家门口撒野
  20. 电梯“骑乘暴打”视频疯传 女子“擦边”网红身份被扒
  21. 多伦多老移民分享最难学英语单词
  22. 超半数亚裔想离开纽约?
  23. 上层负责斗法,下层负责受罪
  24. 山东惊传大爆炸!辟方称仅1人伤 影片疑遭下架
  25. 北京西站:一座车站留给信访人的最后体面
  26. SpaceX火箭残骸将撞月球 威力达3吨TNT 网友争睹
  27. 中共威胁横跨第一岛链 台湾建构无人机为防止战争
  28. 中国出入境管制收紧,学者:趁还能离开快走
  29. 死后仍率军迎敌?不败的骑士传奇
  30. 美签保证金成效惊人:50国逾期滞留骤降99.9%
  31. 中国特大国企国家电网前董事长卸任后被带走调查
  32. 纽约时报:中国如何监视在华外国人
  33. 中国出境管理新规9月上路 学者:能离开赶紧离开
  34. 美国13州叫停数据中心税收优惠
  35. 9月新规生效,绿卡排期喜忧参半
  36. 央视起底多个网红游乐项目:藏致命风险
  37. 华州野火狂烧 居民紧急撤离 形容野火"像核爆炸"(视)
  38. 3400项中国贴牌设备流入公部门 国防部也中招
  39. 全球右转,各国赶人,夹缝里的人们该怎么办?
  40. 美350磅巨汉男教师把学生当“垫脚凳” 下场惨了
  41. 波音地位不保?“未来客机”没窗户 长相太震撼
  42. 如何应对被中共“恢复中国国籍” 最后一点最重要
  43. 张雅笛被捕一周年:寻找大家的朋友张雅笛
  44. 以色列指美国取消袭击伊朗 事前未获通知
  45. 中国男子清迈殴打妻子致死
  46. 穿戴奢侈品的王虹,戳破了多少人的“不体面”?
  47. 2千万或成犯罪动机 华人绑架枪杀案嫌犯身份曝光
  48. 两女婴产房被错抱人生互换37年 生父知真相脑出血…
  49. 伊朗否认与美谈判!仅与阿曼协商荷莫兹海峡通行
  50. 敦煌年薪90万聘美籍主播古爱华 网批聘用间谍 崇洋媚外
  51. 熊本地震女死者坎坷身世曝光 父谴磨世后撑起家庭
  52. 黄仁勋7500万美元捐建艺术学院
  53. 新西兰外长攻击华裔议员,中国提出抗议
  54. 美国120万辆特斯拉遭调查
  55. 美伊战争为什么打不完?
  56. 苹果“独吞”数十亿关税退款?
  57. 川普又TACO取消空袭 伊朗官媒嘲讽黔驴技穷
  58. 伊朗声称,在荷莫兹海峡上空击落MQ-9无人机
  59. 超强台风“白海豚”正奔向中国 浙江等省紧急防御
  60. 关税?中国?劳工关系?德国汽车工业困境谁之过