Qwen3.8 现在是预览版、还在迭代,没有标准跑分(SWE-bench/GPQA 都没出)。但第三方已经有人上手实测了,结论很反常识——跑分更高的 Kimi K3,在实测里翻车了;没跑分的 Qwen3.8,反而稳。对普通开发者来说,这才是该看的信号。
2026 年 7 月 19 日,阿里通义千问放出 Qwen3.8-Max-Preview——2.4T 参数、1M 上下文、MoE 架构,官方口径"仅次于 Anthropic Fable 5"。但和历次 Qwen 一样,官方完整 benchmark 博文还没发,benchlm.ai 上它的分数栏写着 "0 of 321 / Coming soon"。作为一个写代码的人,我不等跑分——我直接上手用。本文基于 techgogogo 7/19 上手实测报告,把 Qwen3.8-Max-Preview 拉到和 Kimi K3、GLM-5.2、DeepSeek V4 Pro、Opus 4.8、GPT-5.6 同一张桌上,聊聊它到底好不好用。
💡先说人话:Qwen3.8 现在是预览版、还在迭代,没有标准跑分(SWE-bench/GPQA 都没出)。但第三方已经有人上手实测了,结论很反常识——跑分更高的 Kimi K3,在实测里翻车了;没跑分的 Qwen3.8,反而稳。对普通开发者来说,这才是该看的信号。
数据可信度图例
✅官方口径/官方榜:厂商官方账号或官方博客公布的数值
🔍权威第三方:媒体/博主上手实测、或独立机构榜单(vals.ai/SWE-bench/LMArena/Artificial Analysis 等)
⚓前代锚定:本代未公布,以前一代同系列已公布数据作下限锚定
⏳待公布:截至今日无任何公开数值,如实留白
一、上手实测:Qwen3.8 到底好不好用?
techgogogo 在 7/19 发布了一份上手测评(原文链接),用的是他惯用的标准化考题,把 Qwen3.8-Max-Preview 和 Kimi K3 拉到同一套题面前对打。这不是跑分,是真刀真枪的 coding 实测,对开发者更有参考价值。
实测项目 1|约束文本生成 + 逻辑推理
限制性文本要求(带格式/字数/结构约束的生成):全对,而且速度更快。24 点数学题、密码推断题:顺利解开。基础推理这关,3.8 干净利落。
实测项目 2|代码开发(最该看的一关)
三个真实 coding 任务,表现是"产出效率明显跃升":
- 网页端太空射击小游戏:UI 与功能完整,能跑
- 3D 飙车程序:运行流畅、无操控故障(这点很关键,下面会说为什么)
- 模仿Trello 的看板应用:还原度极高,只漏了一个单独的"清除待办"按键
对日常写代码的人来说:小游戏、3D 交互、复杂 UI 还原这三类任务,3.8 能一次出到"基本能用"的水平,不用反复调。Trello 那个漏了一个按键,属于接近完成但差最后一口气——典型预览版状态。
实测项目 3|同题对比 Kimi K3(最有意思的部分)
同样这套题,Kimi K3 的表现是:答题失误、赛车失控、界面 bug、生成耗时极长。
⚠️反常识警报:Kimi K3 的 SWE-bench Verified 跑分是 93.4%(vals.ai #3,自报),Qwen3.8目前 0 个跑分。但同一套实测题里,跑分高的 K3 翻车、没跑分的 3.8 反而稳。这不是说 K3 不行,而是跑分和真实 coding 体验之间存在明显落差——对选模型干活的人来说,这个落差比榜上那几分重要得多。
techgogogo 的总结:Qwen3.8 综合实力更出众,响应速度优势突出。注意这是 7/19 预览版的第一手结论,模型还在"以天为单位"迭代,正式版(预计近期开源)可能更强。
二、六款模型横评:跑分表 + 实测张力
下表统一用业内可比性最强的几项基准。主角 Qwen3.8-Max-Preview 的标准跑分格如实留白(⏳)——官方未公布、benchlm 仍 0/321;但补一列"上手实测定性"作为开发者视角的真实信号。Fable 5 作为官方对标的"天花板"列入参考。
模型 | 参数/形态 | SWE-bench | SWE-bench | GPQA | 上手实测定性 |
Qwen3.8-Max | 2.4T MoE | ⏳ 待公布 | ⏳ 待公布 | ⏳ 待公布 | 🔍 techgogogo:小游戏/3D/Trello稳、同题K3翻车 | Trilogy 架构推理盲审 80/100(K3 83) | AICodeKing KingBench 65/80 总榜第二(Fable5 > 3.8 > Opus4.8) |
Kimi K3 | 2.8T 开源 | 93.4% 🔍 | — | 93.5% 🔍 | 🔍 techgogogo 同题翻车(答题失误/赛车失控/bug/耗时长) | Trilogy 架构推理 83/100(略胜Qwen80),lifecycle/版本重生成/更快/省token |
GLM-5.2 | 开源 1M ctx | 未直接公布 | 58.4 ✅ | — | 开源编程登顶;槽点:思考过久 |
DeepSeek | 开源 1M ctx | 80.6% ✅ | 55.4 ✅ | — | 成本敏感型首选;架构创新型 |
Claude | 闭源 海外 | 88.6% 🔍 | 69.2% 🔍 | — | 复杂工程任务质量最优解 |
GPT-5.6 | 闭源 海外 | 96.2% 🔍 | 64.6% 🔍 | — | 标准任务之王;出海团队 |
Fable 5 | 闭源 Anthropic | 95.0% 🔍 | ~80% 🔍 | — | Qwen 官方对标对象 |
数据来源:techgogogo 7/19 上手实测、Trilogy AI 架构推理盲评(StackPerf 框架)、vals.ai、SWE-bench 官方榜、Artificial Analysis、benchlm.ai,及各厂商官方(@Alibaba_Qwen X、智谱 GLM 文档、DeepSeek、OpenAI、Anthropic、SCMP)。"—"表示该模型该项基准未公开成绩,如实留白。Qwen3.8 标准跑分格留白是事实——benchlm.ai 当前标注 "0 of 321 published",非编造。前代 Qwen3.7-Max 锚定值来自 qwen.ai 官方博客与 benchlm.ai。
读表要点:标准跑分上,GPT-5.6 Sol(96.2%)和 Fable 5(95.0%)是双高天花板,Kimi K3 以 93.4% 居开源之首,Opus 4.8 次之,DeepSeek V4 Pro 与前代 Qwen3.7-Max 锚定值同档(80% 段)。但最右边一列才是开发者该盯的:跑分王 Kimi K3 在 techgogogo 同题实测里翻车,没跑分的 Qwen3.8 反而稳。跑分高 ≠ 你用着顺手,这是这张表最重要的信息。
三、上手门槛与性价比:现在就能白嫖
跑分可以等,但能不能马上上手用、花多少钱,是开发者更关心的。Qwen3.8-Max-Preview 这点很友好:
1千问 PC 端 / Web 端:直接免费体验,零门槛试。想先摸底够不够用的,从这里开始。入口
2阿里云 Token Plan 个人版:39 元/月起,可接 Claude Code / Cursor / Qwen Code 当后端模型。重度 coding 用户走这条。
3Qoder 平台:上线限时1 折、夜间0.2 折(活动页)。夜里跑长任务的,成本能压到极低。
!对比 Kimi K3:K3 是开源权重(7/27 前释出),可私有化部署;Qwen3.8 目前只能走 API/百炼,权重"即将开源"但还没开。要私有化的,现阶段 K3 更现成;要现成好用、低成本 API 的,3.8 更顺手。
✅一句话性价比:免费试用门槛最低(千问 Web 端)、重度用户 39 元/月 Token Plan、夜间跑活 0.2 折——Qwen3.8 在"上手门槛 + 成本"这两项上,对个人开发者是目前最友好的国产旗舰之一。
四、两份实测,结论不一致:该信哪个?
第一份实测——techgogogo(7/19,原文):用标准化考题对打,Kimi K3 的 SWE-bench Verified 跑分 93.4%(自报、vals #3),但在真实 coding 题(小游戏、3D 飙车、Trello 看板)里翻车——赛车失控、界面 bug、生成耗时极长;Qwen3.8 反而稳,3D 飙车"运行流畅无操控故障"、Trello 看板"还原度极高只漏一键"。这一份里,没跑分的 3.8 赢了跑分王 K3。
第二份实测——Trilogy AI(原文):换了维度,结论就变了。作者用自研 StackPerp 框架、两个陌生 GitHub 仓库、统一环境 OpenCode 1.17.13 控制变量,做"软件架构与代码推理"盲审——要求模型分析陌生代码库、设计系统集成、定义数据契约、追踪完整数据流。最终 Kimi K3 得 83/100、Qwen3.8 得 80/100,K3 略胜 3 分(即此前说的"三点之差")。而且各有所长:K3 在生命周期状态、版本重生成上更强,且更快、更省 token;Qwen3.8 在系统边界划分更清晰、能捕获 replay 元数据、工具调用次数更少。这份里,K3 在架构推理上扳回一城。
💡两份实测的张力,才是真实该看的东西:techgogogo 场景 3.8 赢、Trilogy 架构推理 K3 略赢——不同维度、不同结论,这比一边倒可信得多。给你的落地判断:日常出能跑的代码(小游戏/3D/UI 生成),3.8 更顺手;复杂架构推理、数据流追踪、版本重生成,K3 略强。别只看一份实测,也别只看跑分——尤其 SWE-bench Verified 顶端(GPT-5.6 96.2% / Fable 5 95.0% / K3 93.4%)已挤在一起、区分度失真。
📊第三份实测——AICodeKing KingBench(有具体分数):AICodeKing 频道《Qwen 3.8 Max (Fully Tested): AN ACTUAL OPEN FABLE COMPETITOR!》(视频,7/19,约 1.1 万播放)用自研 KingBench 跑 3.8,对比 Fable 5 / Opus 4.8 / Kimi K3 / GLM-5.2 / GPT-5.6 Sol。Qwen3.8 Max 得 65/80,总榜第二,排在 Fable 5 之后、Opus 4.8 之上。强项:frontend / Three.js / SVG / game / math / agentic;满分项:弓箭游戏、hard math、长程 agentic 任务;Claude Code 里快且能干,长程任务仍有短板。来源:博主视频描述(自研 benchmark,分数体系与 Trilogy 不同、不可直接横比,各自结论并列参考)。
五、各模型该用在哪(开发者版)
基于实测 + 跑分 + 上手门槛,给个落地的开发者用法建议,不绕弯:
Qwen3.8-Max-Preview
日常 coding、小游戏/3D/UI 生成、长程工程任务。上手门槛最低、响应快、实测稳。现在是预览版,等正式开源后私有化也能上。
Kimi K3
要私有化部署、跑分党、前端 Code Arena 场景。但实测工程稳定性有坑,上手先小范围试,别直接扔长程任务。
GLM-5.2
开源、1M 上下文、项目级工程。性价比高,但"思考过久"是已知槽点,急活儿慎用。
DeepSeek V4 Pro
成本敏感、高吞吐批量活。运行成本比 V3.2 降 3.7×,1M 上下文,开源可自部署。
Claude Opus 4.8
复杂工程、代码质量优先(SWE-bench Pro 69.2% #1)。出海团队、不差钱、要质量天花板。
GPT-5.6 Sol
标准任务、终端任务之王(Verified 96.2% #1)。出海、标准工程流水线首选。
Fable 5(参考)
综合天花板,Qwen 官方对标对象。国内不易直接用,作能力上限参照。
一句话口诀
日常顺手用 3.8,私有化看 K3/GLM,成本看 DeepSeek,出海质量看 Opus/GPT-5.6。
六、别急着下结论的几个点
- 3.8 还是预览版,官方称"以天为单位迭代"。techgogogo 7/19 实测是第一手快照,正式版(预计近期开源)可能更强也可能调偏,别把预览结论当定论。
- 标准跑分仍未公布(benchlm 0/321)。官方一旦放分,尤其盯SWE-bench Pro——前代 Qwen3.7-Max 是 60.6%,3.8 若进 70+ 段,才算坐实"仅次于 Fable 5"的口径。
- Kimi K3 跑分是自报,权重 7/27 前释出,93.4% 尚待独立复现;它在 techgogogo 实测翻车不等于它不行,而是说明单看跑分会误判。
- 本文实测依据为三份第三方上手实测:techgogogo(标准化考题,3.8 赢 K3)、Trilogy AI(架构推理盲审,K3 略胜 83:80)、AICodeKing KingBench(65/80 总榜第二,Fable 5 > 3.8 > Opus 4.8)。三份综合看:3.8 在日常 coding / 游戏 / 前端 / 数学 / agentic 强、综合排 Fable 5 之下 Opus 4.8 之上,架构推理略逊 K3——预览阶段谁强谁弱还没定论。建议你自己拿同类题在千问 Web 端免费跑一遍复验,这才是属于你的真实结论。
本文数据截止 2026-07-20。
七、为什么 3.8 值得盯:三个真本事
本节为定性解读视角,非跑分——提炼自一段对 Qwen3.8 Max 的分析视频(来源),并挂上前文三份实测佐证。帮你从分数之外,理解 3.8 凭什么被称作"开源版 Fable 5 挑战者"。
1 推理下限(reasoning floor)高:小模型简单题能答、复杂多步逻辑就崩(猜、幻觉、漏步、代码看着对跑不通)。2.4T MoE 的 3.8 认知面更大,难任务前不易崩。实测佐证:AICodeKing KingBench 里 3.8 在长程 agentic 任务、hard math 拿满分——恰是"推理下限高"的直接体现。
2 长程抗漂移(agentic persistence,抗 slopification):长会话里很多模型"越改越烂"——忘了原约束、改了不该改的、风格漂移。3.8 被定位成能在长 messy 工作流里锁住原始指令。实测佐证:techgogogo 里 Trello 看板"还原度极高、只漏一个键"(指令 adhere 到位)、Trilogy 里"系统边界划分更清晰、工具调用更少"(结构维持得住)。
3 开源权重 = 控制力:私有化部署(金融/医疗/政企数据不出域)、可微调、长程 agent 不被"按 token 烧钱"、不被安全过滤卡住正当技术活。这是闭源 Opus/Fable 5 给不了的。待 3.8 正式开源权重释出,这条才真正兑现(现阶段只能走 API/百炼)。
✅ 最聪明的用法:Qwen + Opus 混合工作流。别让一个模型干所有事——Opus 4.8 / GPT-5.6 Sol 做规划与终审(架构、风险、最后 polish),3.8 做长程执行(写文件、跑循环、数据处理、重复活),最后再交 Opus/Fable 5 复核。规划用闭源的精度、执行用开源的自主与低成本、复核再回到闭源的严谨——这才是这波模型潮里"开放+闭源"该有的搭配,而不是非此即彼。
结语
Qwen3.8-Max-Preview 今天还没有一个标准跑分,但已经有三份第三方把它拉到一起实测——结论各有趣味:techgogogo 标准化考题里 3.8 赢(K3 翻车),Trilogy AI 架构推理盲审里 K3 略赢(83:80),AICodeKing KingBench 里 3.8 拿 65/80 总榜第二、排在 Fable 5 之后 Opus 4.8 之上。三份合起来才画出 3.8 的真实水位:日常 coding / 游戏 / 前端 / 数学 / agentic 是强项、综合稳居 Fable 5 之下 Opus 4.8 之上,但架构推理还略逊 K3。对写代码的人,这比榜上 93.4% vs 96.2% 那几分重要得多——日常出能跑的代码、响应快、上手便宜,3.8 都做到了。等它正式开源放分那天,再回头看这三份实测,验证一下"不同维度各有胜负"是不是常态——那才是这波模型潮里最值得琢磨的事。