发布日期:2026-08-20 | 适用人群:AI 开发者 / 产品选型团队 / 模型研究者 | 数据来源:各平台官网及官方发布公告(2026-08-20)

2026 年 8 月是国内大模型旗舰竞争最激烈的月份之一。Kimi K3(2026-07-17 发布,2.8 万亿参数)以 BrowseComp 90.4 和 DeepSWE 67.3 宣示长周期编程与知识工作的新基准;GLM-5.3(2026-08-14 发布,7530 亿 MoE 参数)以极致后训练 Scaling 实现能力跃升 50%,在 CyberGym 安全漏洞发现上登顶第一;DeepSeek V4-Pro(2026-08-13 正式版)引入三档推理强度和峰谷定价机制,原生支持 Responses API,正面对标 Agent 生产场景。三款模型均采用 1M token 上下文窗口,均支持 MoE 稀疏架构,但在能力重心、定价策略和场景适配上走向截然不同的三条路。本文基于官方文档和官方发布公告(2026-08-20 实时数据),完整呈现三款模型的核心参数、基准表现、定价对比与选型建议。


三大旗舰模型核心参数一览

维度 Kimi K3 GLM-5.3 DeepSeek V4-Pro
发布时间 2026-07-17 2026-08-14 2026-08-13(正式版)
参数规模 2.8 万亿(MoE) 7530 亿(MoE) 未披露
上下文窗口 1M tokens 1M tokens 1M tokens
最大输出 未披露 128K tokens 未披露
推理强度控制 low / high / max low / high / max low / high / max
多模态 文本 + 图片 + 视频 仅文本 仅文本
开源状态 权重 2026-07-27 开放 两周后开放 已开源(HuggingFace/ModelScope)
API 协议 OpenAI 兼容 OpenAI 兼容 OpenAI 兼容

Kimi K3:2.8 万亿参数,长周期工程任务的新标杆

Kimi K3 是月之暗面(Moonshot AI)于 2026 年 7 月 17 日发布的旗舰模型,参数规模 2.8 万亿,采用 896 个专家中激活 16 个的 MoE 稀疏架构,被官方描述为"世界首个开源 3T 级模型"。

架构与技术特点

  • Kimi Delta Attention(KDA):新型注意力机制,提升长上下文处理效率
  • Attention Residuals(AttnRes):与 KDA 配合,降低长序列推理的注意力衰减
  • 1M token 上下文:支持超长文档、代码库、视频内容的统一输入
  • 原生视觉能力:原生支持文本、图像、视频多模态输入,无需外挂视觉适配器
  • 整体扩展效率提升约 2.5×(相比 Kimi K2,官方数据)

基准测试表现

基准 Kimi K3 表现
DeepSWE(软件工程) 67.3(mini-SWE-agent harness,官方排行榜)
BrowseComp(网页理解) 90.4(无上下文压缩时)
内核优化任务 与 Claude Fable 5 相当,大幅优于 GPT 系列旗舰
整体综合能力 仍落后于 Claude Fable 5 和 GPT 5.6 Sol

Kimi K3 的差异化优势集中在长周期工程场景:可持续进行长时工程会话、在 GPU 内核优化任务(AttnRes、KDA、MLA)上与顶流比肩、自主构建 MiniTriton 编译器实现 Triton 对等性能、48 小时内完成 4mm² 芯片设计(8,700+ tokens/s)、支持 120+ 轮次递归自我改进的研究报告生成。

API 接入与定价

Base URL:https://api.moonshot.cn/v1
Model:kimi-k3
费用类型 价格
输入(缓存未命中) $3.00 / MTok
输入(缓存命中) $0.30 / MTok
输出 $15.00 / MTok

缓存命中后输入价格降至 $0.30/MTok(降幅 90%),是三款模型中缓存收益最显著的一个。人民币定价参考平台定价页:输入(未命中)20 元/M,输入(命中)2 元/M,输出 100 元/M。


GLM-5.3:后训练 Scaling 的能力跃升,安全漏洞发现登顶

GLM-5.3 是智谱 AI 于 2026 年 8 月 14 日发布的旗舰模型,参数规模 7530 亿(MoE),基座模型与 GLM-5.2 完全相同。能力跃升来源是"极致后训练 Scaling"——官方表述为"数十倍的长程任务环境训练",重心放在编程能力和网络安全漏洞发现两个方向。

架构与技术特点

  • 后训练 Scaling 驱动:基座不变,通过后训练实现能力跃升约 50%,路线与加大预训练参数不同
  • 强制推理(thinking always on):推理功能无法关闭,支持 low / high / max 三档强度,默认 max
  • 1M 上下文 + 128K 最大输出:是三款模型中唯一明确标注最大输出长度的
  • 纯文本:当前版本不支持图片/视频输入

基准测试表现

基准 GLM-5.2 GLM-5.3 对比
Terminal-Bench 3.0 4.6 28.3 +515%
DeepSWE v1.1 46.2% 66.9% +44.8%
CyberGym(安全漏洞) 77.2% 84.5%(第一) +9.5%
ExploitBench(漏洞利用) 24.4% 54.4% +123%
Z.ai Code Bench(Max) 23.4% 34.5% +47.4%

GLM-5.3 在 CyberGym 评测中累计发现 2436 个漏洞,登顶排行榜第一位;Terminal-Bench 3.0 从 4.6 跃至 28.3 是三款模型中涨幅最大的单项基准改善。编程能力被多家媒体测评描述为"追平 Claude Fable 5"。

API 接入

端点:https://open.bigmodel.cn/api/paas/v4
Model:glm-5.3

官方文档暂未公开具体 API 定价,建议访问 bigmodel.cn 定价页确认。功能支持:Function Calling、流式输出、结构化输出、上下文缓存。


在这里插入图片描述

DeepSeek V4-Pro:正式版强化 Agent 能力,峰谷定价重塑成本结构

DeepSeek V4-Pro 于 2026 年 8 月 13 日正式发布(预览版为 2026 年 4 月 24 日),正式版相比预览版的最大变化是 Agent 能力的显著增强,以及三档推理强度(low/high/max)和峰谷定价机制的引入。

核心更新(正式版 vs 预览版)

维度 V4 预览版(4月24日) V4-Pro 正式版(8月13日)
Agent 能力 基础 大幅增强,生产环境表现提升显著
推理档位 未提及 low(简单任务)/ high(日常 Agent)/ max(高复杂)
Responses API 未提及 原生支持(适配 Codex)
定价机制 旧价格 峰谷双轨,空闲为高峰半价

定价(元 / 百万 Token,2026-08-17 起生效)

类型 V4-Flash 空闲 V4-Flash 高峰 V4-Pro 空闲 V4-Pro 高峰
输入(缓存未命中) 1.5 3.0 4.5 9.0
输入(缓存命中) 0.05 0.10 0.15 0.30
输出 4.5 9.0 13.5 27.0

高峰时段:北京时间 9:00–12:00 及 14:00–18:00,其余为空闲时段(价格为高峰半价)

V4-Flash 并发上限 2500,V4-Pro 并发上限 500。

竞争定位

DeepSeek V4-Pro 在官方发布时强调针对 Claude Code、OpenCode 等主流 Agent 产品做了专项优化,内部反馈"Agent 任务使用体验优于 Sonnet 4.5"。Responses API 原生支持使其在 Codex 生态中有直接接入优势,无需二次适配。架构层面引入新注意力机制(token 维度压缩 + DSA 稀疏注意力),降低算力与显存需求。


三款模型横向对比:按场景选型

定价对比(人民币,低估场景优先)

模型 输出定价(正常/缓存命中输入) 适合场景
Kimi K3 输出 100 元/M,缓存命中输入 2 元/M 高缓存命中率的长文档 RAG、知识工作
GLM-5.3 待官方公布 编程 / 网络安全专项任务
DeepSeek V4-Pro(空闲) 输出 13.5 元/M,缓存命中输入 0.15 元/M Agent 任务、避开高峰的批处理
DeepSeek V4-Flash(空闲) 输出 4.5 元/M,缓存命中输入 0.05 元/M 大量调用、成本敏感场景

按场景快速选型

场景 推荐模型 核心理由
GPU 内核 / 编译器开发 Kimi K3 唯一在此类任务与 Fable 5 相当的开源模型
长周期工程 Agent(>50 步) Kimi K3 120+ 轮递归自改进,长会话上下文稳定
网络安全漏洞发现 GLM-5.3 CyberGym 第一,ExploitBench 54.4%
编程 Agent + 极端速度提升 GLM-5.3 Terminal-Bench 3.0 涨幅最大(+515%)
多模型切换 + 成本控制 DeepSeek V4-Flash 空闲时段输出 4.5 元/M,并发上限最高
Codex / Responses API 深度集成 DeepSeek V4-Pro 原生 Responses API,官方针对 Claude Code 优化
图像/视频多模态输入 Kimi K3 唯一原生支持视觉输入的旗舰
超长文档 + 高缓存命中率 Kimi K3 缓存命中输入降 90%,BrowseComp 90.4

基准测试横向对比

基准 Kimi K3 GLM-5.3 DeepSeek V4-Pro
DeepSWE(软件工程) 67.3 66.9% 未披露(官方图片形式)
CyberGym(安全漏洞) 未披露 84.5%(第一) 未披露
BrowseComp 90.4 未披露 未披露
Terminal-Bench 未披露 28.3(+515% vs 前代) 未披露
Agent 能力综合 领先开源,落后 Fable 5 追平 Fable 5(编程专项) 优于 Sonnet 4.5(官方)

三款模型各有基准侧重:Kimi K3 在网页理解和长周期任务上有独特优势,GLM-5.3 在安全和编程专项上取得最高分,DeepSeek V4-Pro 的综合基准以图片形式发布,开发者需参考官方原始表格。


在这里插入图片描述

FAQ

Q:三款模型都支持"推理强度"控制(low/high/max),有什么区别?

三款模型均引入了相同名称的推理强度参数,但含义略有差异。GLM-5.3 和 Kimi K3 的推理功能强制开启,low 档在简单任务上可大幅降低耗时和 token 消耗;DeepSeek V4-Pro 的 low 档官方建议用于简单问答,high 用于日常 Agent,max 用于高复杂度推理任务。实际成本差距:max 档 token 消耗通常是 low 档的 3-8 倍,按量计费场景选对档位对账单影响显著。

Q:Kimi K3 的 2.8 万亿参数和 GLM-5.3 的 7530 亿参数,哪个"更强"?

参数量不等于能力。Kimi K3 激活参数(每次推理实际使用)约为 2.8T × (16/896) ≈ 500 亿,GLM-5.3 同样是 MoE 稀疏架构,激活参数规模与总量差距很大。从实际基准来看,两者 DeepSWE 分数接近(67.3 vs 66.9%),但擅长方向不同:Kimi K3 长周期、视觉任务更强;GLM-5.3 安全漏洞发现和终端任务跃升更显著。

Q:DeepSeek 的峰谷定价对我的项目影响多大?

取决于任务时段分布。如果任务可以调度到空闲时段(非北京时间 9:00–12:00 及 14:00–18:00),V4-Pro 的实际输出成本为 13.5 元/M,V4-Flash 为 4.5 元/M;若任务主要发生在工作日高峰时段,成本翻倍。对于可预测的批处理任务(如夜间数据处理、周末报告生成),调度到空闲时段是最直接的降本手段。

Q:GLM-5.3 的定价什么时候会公布?

根据目前官方文档,bigmodel.cn 定价页暂未列出 GLM-5.3 价格,建议定期查看 docs.bigmodel.cn 或关注智谱 AI 官方公告。考虑到 GLM-5.2 的现有定价区间,以及市场竞争压力,预计定价不会超过 Kimi K3 的人民币标价。

Q:这三款模型都开源了,可以本地部署吗?

Kimi K3 权重已于 2026-07-27 正式开放;GLM-5.3 的官方公告提到两周后开放权重(即约 2026-08-28 前后);DeepSeek V4 权重已发布至 HuggingFace 和 ModelScope。但 2.8T 和 7530 亿参数级别的模型对显存要求极高,即使量化版本也需要多卡集群,本地部署适合研究机构和有充足 GPU 资源的企业。


结语

2026 年 Q3 的旗舰模型竞争正在从"谁的基准分最高"转向"谁的场景覆盖最精准"。Kimi K3 以 2.8T 参数和原生视觉能力覆盖最宽的输入模态,在长周期工程任务和网页理解上确立了开源阵营的新高度;GLM-5.3 以后训练 Scaling 实现了编程和安全漏洞发现的集中突破,用更小的基座参数换来了更有针对性的能力跃升;DeepSeek V4-Pro 以原生 Responses API 和峰谷定价直接切入 Agent 生产部署场景,空闲时段的价格竞争力在三款中最突出。选型的关键是任务场景的精确匹配:长周期 + 视觉选 Kimi K3,安全/编程专项选 GLM-5.3,Agent 大量调用 + 成本控制选 DeepSeek V4-Flash/Pro。

数据来源(均为官方渠道,2026-08-20):

  • Kimi K3 发布公告:kimi.ai/blog/kimi-k3 | 定价:platform.kimi.com/docs/pricing/chat-k3
  • GLM-5.3 模型文档:docs.bigmodel.cn/cn/guide/models/text/glm-5.3
  • DeepSeek V4-Pro 正式版公告:api-docs.deepseek.com/zh-cn/news/news260813 | 定价:api-docs.deepseek.com/zh-cn/quick_start/pricing

价格随平台政策变化,购买前请以各官网最新定价为准。


延伸阅读

  • Kimi K3 官方发布公告:https://www.kimi.ai/blog/kimi-k3
  • GLM-5.3 模型文档:https://docs.bigmodel.cn/cn/guide/models/text/glm-5.3
  • DeepSeek V4-Pro 正式版公告:https://api-docs.deepseek.com/zh-cn/news/news260813
  • DeepSeek 定价页:https://api-docs.deepseek.com/zh-cn/quick_start/pricing
  • 七牛云大模型广场(统一 API Key 接入多模型,含 Kimi/DeepSeek/GLM):https://www.qiniu.com/ai/models
Logo

葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。

更多推荐