文章总结: 彼德研究院20260831大模型能力监测样刊称:开源第一梯队完成权重兑现,KimiK3、Qwen3.8Max、GLM-5.3、腾讯Hy4四强并立,GLM-5.3许可非MIT且Hy4独立分待互证;闭源由ClaudeOpus5以AA指数63领跑,OpenAI守编码Agent,xAI守性价比;建议8月31日前迁移Codex默认模型,企业通用场景优选Opus5,未证实传闻不写入能力结论。 综合评分: 78 文章分类: AI安全,威胁情报,产品介绍
模型前线日刊_20260831_能力监测
彼德研究院
2026年8月31日 08:56 上海
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
模 型 前 线
样刊(试运行)
主流大模型能力升级与进展状态监测
彼德AISOS 技术团队 支持并交付
| | | | — | — | | 感知窗口 | 2026 年 8 月 30 日 00:00—24:00(北京时间);排行榜与境外评测回溯至前 7 日成熟窗 | | 交付日期 | 2026 年 8 月 31 日 | | 版本性质 | 样刊(试运行)。版式与栏目仍可能调整,所载判断供参阅,不作为对外正式发文。 | | 监测对象 | OpenAI GPT-5.x / o 系列 / Codex;Anthropic Claude Mythos / Fable / Opus / Sonnet 5.x;Google Gemini 3.x;xAI Grok 4.x;Meta Muse / Llama 4;DeepSeek V4;阿里 Qwen 3.8;Moonshot Kimi K3;Z.AI GLM-5.x;Mistral、腾讯 Hy、字节 Seed、MiniMax 等 | | 本日活跃度 | 中偏低。无美系旗舰新底座。开源侧兑现 GLM-5.3 权重(8/28 夜间落地,8/29 二次确认);Hy4 preview 与 Qwen3.8-Flash-Next 进入成熟窗扩散。产品侧 DALL-E GPT 于 8/30 退役;8/31 双到期节点进入当日窗口。 | | 一句话判断 | 开源第一梯队完成权重兑现(K3 / Qwen3.8 Max / GLM-5.3 / Hy4);闭源综合智力仍由 Anthropic Claude 系列领跑,OpenAI 守编码 Agent,xAI 守性价比。Hy4 独立分仍待互证,不得把内部盲测写成第三方排名。 |
当日清单(能力与进展,共 11 条)
1. 腾讯 Hy4 preview(8/28 开源)进入成熟窗扩散;WorkBuddy / CodeBuddy 两周免费仍在。
2. 智谱兑现 GLM-5.3 权重开源(HF / ModelScope);许可为 GLM-5.3 License,非 MIT。
3. Qwen3.8-Flash-Next(Qwen4 架构预览)继续向网关与社区量化扩散。
4. AA Intelligence Index v4.1.1 8/30 快照:Opus 5(max)63 领跑;Grok 4.6 / GPT-5.6 Sol 约 61;Kimi K3 / GLM-5.3 约 60。
5. OpenAI 确认 ChatGPT 内官方 DALL-E GPT 于 8/30 退役,导向内置 ChatGPT Images。
6. Codex(ChatGPT 登录)8/31 下线 GPT-5.4 / 5.4 mini;Sonnet 5 入门价同日结束。
7. Moonshot 旧线 kimi-k2.5 / moonshot-v1 对新增用户关闭,平台日落指向 8/31。
8. Grok 4.6 仍为 xAI 现役旗舰;Grok 4.7 至本期仍未官宣上线。
9. 排行榜快照:BenchLM / Artificial Analysis / LMArena 三口径互证;Hy4 仍待独立分。
10.路透称月之暗面洽谈托管 Kimi K3、美方官员指控蒸馏 Fable——未获第二信源。
11.Nvidia–Perplexity / Nvidia–Hugging Face 交易报道仍属未完成交易,不升格为能力事件。
一、确认发布与升级
(一)智谱兑现 GLM-5.3 权重,许可改为自有协议
【Z.ai 官方 8 月 28 日,IT之家 / GIGAZINE 8 月 29 日二次确认】Z.ai 宣布 “GLM-5.3 is now open-weight”,Hugging Face 仓库 zai-org/GLM-5.3 出现 Initial commit 0828,对应 8 月 14 日发布时“两周内开源”承诺。模型沿用 GLM-5.2 量级 MoE(公开口径约 744B–753B 总参 / 约 40B 激活),1M 上下文,定位智能体编程与网络防御;提供 BF16 / FP8,适配 vLLM / SGLang / Transformers。许可名为 GLM-5.3 License:允许本地部署、微调与一般商用;年营收超过 100 亿美元且对外提供模型服务时需通过 Z.ai 安全审查。Flash 线 8 月 26 日仍走 MIT,形成分叉。
| | | | — | — | | | 能力含义:开源可用不等于协议无门槛。中小团队可下载、私有化、二次开发;超大规模对外售卖被协议拦住。官方为此追加两周安全评估——对工控/等保是加分,对无审查二次分发是减分。 |
证据边界:独立 AA 分数来自既有 API/权重评测快照,不等于本周末新跑分。参数总量在不同页面写作 744B 或 753B,以 HF safetensors 计数为准。CyberGym 等安全基准多为厂商/单源,不得据此宣布“网络安全第一”。
参考来源 https://z.ai/blog/glm-5.3 ;https://huggingface.co/zai-org/GLM-5.3 ;IT之家 2026-08-29;GIGAZINE 2026-08-29
事件发生 2026-08-27 17:16 UTC(北京 8/28 凌晨提交) 报道时间:2026-08-28—29 官方与两家中文媒体构成二次确认
(二)腾讯 Hy4 preview:开源第一梯队扩员,独立分仍待互证
【腾讯官方 8 月 28 日,Reuters 同日跟进】混元发布并开源 Hy4 preview:770B 总参 / 49B 激活 MoE,上下文超过 1M。官方定位开源第一梯队,面向长程软件工程、重文档办公与科研。产品侧 WorkBuddy / CodeBuddy / 元宝 / ima 首发,API 经腾讯云 TokenHub 与 OpenRouter;WorkBuddy 与 CodeBuddy 两周免费,Hy3 免费期延至 9 月 30 日。国内价:缓存命中 ¥0.3 / 输入 ¥6 / 输出 ¥18 每百万 tokens。官方内部盲测:163 名专家、203 项工程任务,均分 2.99/4.00,略高于 GLM-5.3(2.92)与 Kimi K3(2.94)。官方自称 Terminal-Bench 2.1 达 85.4(Hy3 为 71.7),并承认早期版本可能过度核验、耗时偏长。AA 8/30 快照尚未收录。
| | | | — | — | | | 能力含义:开源旗舰从“三强”(K3、Qwen3.8 Max、GLM-5.3)变为“四强并立”的供给判断可以写,但独立评测尚未跟上。不得把内部盲测直接写成第三方排名。对国内 Agent / 办公套件,Apache 2.0 比 GLM-5.3 自有协议更好签。 |
证据边界:参数、上下文、产品入口与免费期来自官方;内部盲测为发布方自测,未见独立复现;API 美元价与人民币价在不同页面并存,引用须标注币种。
参考来源 https://www.tencent.com/tencent-releases-and-open-sources-tencent-hy4-preview/ ;https://hy.tencent.ai/research/hy4-preview ;https://huggingface.co/tencent/Hy4-preview
事件发生 2026-08-28 报道时间:2026-08-28 官方与通讯社构成两条信息链;8/30 为成熟窗扩散日
(三)阿里 Qwen3.8-Flash-Next:Qwen4 架构预览继续落地
【Qwen 官方博客 8 月 26 日,权重在成熟窗持续扩散】Qwen3.8-Flash-Next 开源:主模型 125B,另加 51B N-gram embedding,每 token 约激活 6B;原生上下文 262K,YaRN 可至 1M。官方角色等同当年 Qwen3-Next 之于 Qwen3.5——提前放出将用于 Qwen4 的架构。生产 API 对应 Qwen3.8-Flash。AA 8/30 转载参考价开始显示约 $0.10/1M。
| | | | — | — | | | 能力含义:这是架构预告,不是 Qwen4 旗舰本身。对研究者的价值高于对采购方;对开发者的价值在低激活量带来的本地/边缘可运行性。 |
证据边界:架构与参数来自官方 README;自报 DeepSWE / SWE-bench Pro 等分数待独立榜复核;社区量化档非官方 SLA。
参考来源 https://qwenlm.github.io/blog ;https://huggingface.co/Qwen/Qwen3.8-Flash-Next
事件发生 2026-08-26(权重) 成熟窗持续扩散至 8 月 30—31 日
(四)OpenAI:DALL-E GPT 退役,8/31 为存量工程风险日
【OpenAI 产品页与既有 Codex changelog】ChatGPT 内官方 DALL-E GPT 于 2026-08-30 退役,官方引导改用内置 ChatGPT Images。这不改变底层图像模型能力,只改变产品入口。GPT-5.6 Sol API 促销价窗口仍有效(至少至 2026-11-21)。Codex changelog 载明:2026-08-31 起,GPT-5.4 与 GPT-5.4 mini 不再向以 ChatGPT 登录的 Codex 用户提供,API Key 会话不受影响。本期无新底座。
| | | | — | — | | | 能力含义:竞争压力下的产品整理与价格防守,不是能力跃迁。8 月 31 日是存量工程风险日:未迁移的 Codex 工作流会断默认模型。 |
证据边界:退役日与下线日期来自官方/开发者文档;图像能力本身无新规格公告。
(五)Anthropic / xAI / Google:无新底座,记状态
Claude Opus 5、Fable 5 / Mythos 5、Sonnet 5 构成现役 5 系。Sonnet 5 API 入门价 2 / 10 美元每百万 tokens 至 8 月 31 日,之后回到 3 / 15。Mythos 5 进入企业安全扫描属产品扩展,非新底座。Grok 4.6(8 月 12 日,500K 上下文,2 / 6 美元)仍为 xAI 现役;4.7 至本期仍无官方上线公告。Gemini Omni Flash 已升正式版;3.8 Flash 仍处内部试用报道,不得写入“已发布”。Gemini 3.7 Flash 仍是 8 月 13 日公开发布的最新 Flash 工作马。
| | | | — | — | | | 能力含义:对大多数企业,Opus 5 在公开评测上常不低于甚至高于 Fable 5,价格约为一半,是更合理的默认旗舰。Mythos 不是可采购的“更强公开模型”。Grok 4.7、Gemini 3.8 Flash、Gemini 3.5 Pro 均不得写成已发布。 |
(六)其他前沿 / 开源(无新底座)
DeepSeek:V4 Pro 0813 与 V4 Flash 0731 为现役;V4-Flash-Vision-Exp(8/21)周末复核入 AA 约 51。Meta:旗舰仍为闭源 Muse Spark 1.2,开源侧 Muse Glimmer 30B。Kimi K3 仍为开源综合第一档之一。Mistral Medium 部分版本日落窗口指向 8/31。字节 Seed、MiniMax 本期无确认旗舰级新发。
二、排行榜快照(可核实口径)
分数变源多、更新滞后不同。下表取 2026-08-30 可核验的公开快照,三套口径不可直接加减。Hy4 独立分仍缺,以“待互证”标注,不写入领先。
| | | | | | | | | — | — | — | — | — | — | — | | 排名 | 模型 | 厂商 | 代表分(口径) | 上下文 | 类型 | 备注 | | 1 | Claude Opus 5 | Anthropic | AA Index 63.0(max) | 1M | 闭源 | 公开智力领跑 | | 2 | Claude Fable 5 | Anthropic | AA 62;Arena Elo 居前 | 1M | 闭源 | Arena 文本高位 | | 3 | Grok 4.6 | xAI | AA Index 60.9(high) | 500K | 闭源 | 性价比前排 | | 3 | GPT-5.6 Sol | OpenAI | AA 视努力档 57–61 | ~1M | 闭源 | 编码 Agent 极强 | | 5 | Kimi K3 | Moonshot | AA 约 60;BenchAlign 80.6 | 1M | 开源权重 | 开源综合领跑档 | | 5 | GLM-5.3 | Z.AI | AA 约 60;权重 8/28 落地 | 1M | 开源权重 | 许可非 MIT | | 7 | Qwen3.8 Max | Alibaba | AA 58;BenchAlign 约 79 | 1M | 开源权重 | 与 Hy4 同分档 | | 8 | GLM-5.3-Flash / Hy4 | Z.AI / 腾讯 | Flash AA 57;Hy4 待互证 | 1M | 开源 | Hy4 不写入领先 |
数据来源与更新:Artificial Analysis Intelligence Index v4.1.1(2026-08-30);BenchLM BenchAlign v5(8/29–8/30 转载);LMArena Text Elo(约 08-27 快照,部分 Preliminary)。Arena Code Elo 近期快照中 Opus 5 常居第一,与文本总榜不完全同序。并列按“同档”处理,0.3–1.0 分抖动不锁定名次。
三、能力维度(只写本期有信号者)
推理 / 数学 / 科学:无新闭源跃迁。AA 智力指数大致为 Opus 5(63)> Fable 5(62)> Grok 4.6(60.9)≈ GPT-5.6 Sol(视努力档)> Kimi K3 / GLM-5.3(约 60)。
编程与软件工程:Sol + Codex 与 Opus 5 + Claude Code 仍是闭源双峰。Hy4 以长程工程为卖点,公开 SWE 待第三方。8 月 31 日前须把 Codex 默认模型迁离 5.4。GLM-5.3 权重落地使开源编程线可私有化,但许可不是 MIT。
多模态:确认增量仍是既有的 Omni Flash(视频续写 / 4K)、Qwen3.8-Flash-Next(原生图文)与 GLM-5.3-Flash(官方称 GLM-5 系首个原生多模态)。DALL-E GPT 退役只改入口。闭源图像生成无新旗舰。
Agent / 工具调用:Grok 4.6 曾与 Opus 5 在部分 Agentic 指数打平。Salesforce 把 Claude 设为 Slack / Agentforce 默认引擎,是“默认值固化”而非基准分变化。
长上下文:1M 已成多数旗舰标配;Grok 4.6 官方为 500K。
速度与价格:立刻可执行:Grok 4.6 为 2 / 6 美元;Sol 促销仍有效;Hy4 国内 ¥6 / ¥18,WorkBuddy 两周免费;GLM-5.3-Flash 约旗舰价 1/10。Fable 5 多数场景不如 Opus 5 划算。
开源与闭源差距:综合差距已收窄到数分。开源第一梯队:Kimi K3、Qwen3.8 Max、GLM-5.3、Hy4 preview、DeepSeek V4 Pro 0813。Arena 盲选偏好与 Mythos 级安全/长程可靠性仍是闭源优势。
四、与能力相关的产业交叉(本期需并观)
(一)产品入口:DALL-E GPT 退役与 8/31 双到期
官方已落地的产品整理:DALL-E GPT 8/30 退役;Codex(ChatGPT 登录)8/31 下线 GPT-5.4 系列;Sonnet 5 入门价 8/31 结束;Moonshot 旧线与部分 Mistral Medium 版本日落窗口指向同日。这不改变基准分,但会打断未迁移工作流。
证据边界:退役与下线日期来自官方产品页 / changelog,属确认事件。
(二)Kimi K3 出海与蒸馏指控(未证实,影响能力叙事)
【路透 8 月 26 日独家,公开转载可核】报道称月之暗面与微软 Azure、亚马逊云、谷歌云洽谈托管 Kimi K3,寻求最高 30% 收入分成;同时载明美方官员指控其蒸馏 Anthropic Fable 以协助构建 K3。企业否认。美方未见正式清单文件。本期无第二信源跟进。
监测处理:托管与分成、官员指控均属同一独家信息链。本刊不把指控写入能力事实,只记录其对境外评测引用与云托管可达性的潜在干扰。观察点:30 日内是否出现正式文书,或三家云厂商任一方公开确认/否认。
(三)交易传闻不升格
Nvidia 接触 Perplexity 高估值投资、Nvidia 收购或重资入股 Hugging Face 等报道在 8 月末媒体高频出现,无双方签字稿。DeepSeek / MiniMax 上市与收入传闻属财务线,不改变本窗口模型能力判断。
五、七日趋势与节点日历
近一周闭源顶层稳定为三角:Anthropic 守综合智力与企业默认位、OpenAI 守编码 Agent 与 Codex 工作流、xAI 守公开智力榜前三档加低价。Google 用 Flash 高频小步填 3.5 Pro 空窗。开源侧自 7 月底起连续扩员(K3 → Qwen3.8 Max → GLM-5.3 / V4-Pro → Hy4 + Qwen4 架构预览),本窗口补上 GLM-5.3 权重兑现。已能覆盖多数企业编码与办公,但 Arena 偏好与受限 Mythos 能力仍差一截。
· 2026-08-31(今日):Codex(ChatGPT 登录)下线 GPT-5.4 / 5.4 mini;Claude Sonnet 5 入门价结束;Moonshot 旧线与部分 Mistral 版本日落窗口。
· 2026-09 上旬:Hy4、Qwen3.8-Flash-Next 进入 AA / Arena 的第一轮独立分——决定内部盲测能否兑现。
· 2026-09:Salesforce Claudeforce 公测范围与“可否切换模型”。
· 待官宣:Gemini 3.8 Flash 是否转公测、Gemini 3.5 Pro 是否解禁、Grok 4.7 是否落地。三者目前均为预告或内部状态。
· 2026-11-21:GPT-5.6 Sol 促销价窗口下限(官方表述为至少至该日)。
六、分用户建议
开发者:编码默认继续 GPT-5.6 Sol + Codex 或 Claude Opus 5 / Claude Code;控成本切 Grok 4.6 或开源 K3 / GLM-5.3 / Hy4。8 月 31 日前迁移 Codex 默认模型。值得马上用:Sol 促销、Grok 4.6、Hy4 两周免费、GLM-5.3-Flash。可以等:Gemini 3.5 Pro、Grok 4.7、Hy4 第三方榜。私有化 GLM-5.3 前先读自有许可。
企业采购:通用知识工作选 Opus 5(智力接近 Fable、价格约一半),不要只因 Arena 第一就全量锁定 Fable 5。安全/红队走 Anthropic 可信访问或 OpenAI Daybreak。协作平台默认模型一旦切换,迁移成本需单独评估。合同写清 MIT / Apache / 自有协议与 8/31 日落。
研究者:本期最值得复现的是 Qwen3.8-Flash-Next 的 QSA / N-gram / Muon 组合,Hy4 770B/49B 与 K3 2.8T/104B 的激活效率对比,以及 GLM-5.3 权重在 vLLM / SGLang 上的实际吞吐。
普通用户:三大闭源助手一周内无体验质变;要低价长文与代码,优先 Kimi、通义、混元/元宝、智谱入口。图像请改走 ChatGPT Images 或国产多模态 Flash。
七、方法与边界
本刊监测范围限于大模型能力、版本、价格、评测,以及直接影响调用与默认选型的产业变化。事实以官方发布为第一优先级;排行榜须至少两家独立口径互证,才写入“领先”判断。内部测试、独家未经确认的并购与指控,一律标为未证实,不进入能力结论。模型名保留英文原名。感知窗口为北京时间上一自然日,交付日为运行日北京日期。本窗口因周日交付,清单含 8/28–8/30 已确认事项,避免把周末漏报当成 8/31 新发布。
主要核验源:openai.com/news 与 Codex changelog;anthropic.com/news 与 platform.claude.com;x.ai 与 docs.x.ai;deepmind.google / ai.google.dev;qwenlm.github.io 与 Hugging Face Qwen;deepseek.com;ai.meta.com;腾讯混元官方页;z.ai 与 Hugging Face zai-org;BenchLM.ai、Artificial Analysis、LMArena / arena.ai。X 官方账号仅作发布核验,不以社交媒体讨论代替评测。
刊名 《模型前线》日刊 期号 20260831 版本 样刊(试运行)
由彼德AISOS 技术团队支持并交付。公开信源合成,供决策参考,不构成投资或采购承诺。
支持与交付
本刊由彼德AISOS 技术团队支持并交付。试运行阶段用于核对栏目、信源口径与版式,不视为正式对外发文。反馈、纠错、监测对象增补及定制监测需求,请联系交付接口人,来信请注明期号「20260831」。
| | | | — | — | | 支持与交付 | 彼德AISOS 技术团队 | | 接口人 | Peter | | 微信 | 13570083210 | | 承接范围 | 日刊编发、信源核验、排行榜快照、定制监测与样刊修订 | | 来件说明 | 请附原始链接或截图。未公开材料请单独标注,本刊默认只采用公开信源。 |
试运行期间不承诺固定更新时刻。正式刊出前,首页「样刊(试运行)」字样保留。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:彼德研究院 《模型前线日刊20260831能力监测》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。










评论