智讯智库

一夜四家公司密集更新,大模型竞速白热化

原创AI
来源闫文清
2026年08月21日02:08
分享
收藏
字体大小

北京时间2026年8月12日至13日前后,AI行业迎来一个罕见的高密度更新窗口:

  • xAI正式发布Grok4.6模型并同步更新API[1];
  • 阿里开放Qwen3.8-2.4T-A95B权重,托管版Qwen3.8-Max也已上线[2-3]
  • DeepSeek的API价格页将V4-Pro当前版本更新为0813[4];
  • 微信原生AI助手“小微”进入有限用户测试,WeLM也再次受到关注[5]。

这个密度,过去一年都少见。


xAI:让Agent把长任务真正跑起来

xAI于8月12日发布Grok4.6,并将其接入Cursor、Grok Build、xAI API及多家第三方平台。

模型支持文本和图像输入,提供50万token上下文与可调节的推理强度;短上下文基础价格为每百万token输入2美元、输出6美元[1,6]。

Grok4.6的补充训练加入了工程数据、由前代模型生成的推理轨迹,以及面向知识工作、编码、网页开发和CAD等任务的强化学习。按照xAI的产品定位,它要处理的已经不只是一次问答,而是跨代码库工程、研究分析、办公产物,以及从想法到应用的多步流程[1]。

这意味着,模型竞争的评价单位正在发生变化:过去比的是一道题答得对不对,现在比的是几十步任务能否持续推进,遇到错误能否恢复,最终产物能否真正交付。


阿里:把Max级权重交给开发者生态

Qwen3.8-Max于8月2日正式公布;8月3日,API服务全面上线;8月12日,阿里又补上关键一步——开放Qwen3.8-2.4T-A95B权重[2-3]。

作为通义千问系列中尺寸最大、性能最强的模型,Qwen3.8-Max采用了MoE(混合专家模型)架构。虽然其总参数量高达2.4万亿,但通过稀疏激活机制,单次推理仅需激活约950亿参数。

这种设计在保证大模型处理能力的同时,大幅降低了计算资源的消耗。此外,该模型支持100万token的上下文窗口,并原生支持多模态视觉能力。

按8月3日前后的榜单,Qwen3.8-Max在Text Arena中排名全球第五,在Vision Arena中排名全球第二;在Code Arena的编程评测中排名全球第四[7-9]。


DeepSeek:用逼近Fable 5性能和极低价格定义新的斩杀线

与此同时,DeepSeek在官网API文档里悄然上线了V4-Pro-0813。[4]

首批社区流传的评测认为,从预览版到正式版,它的Agent基准成绩全面跳涨:Terminal Bench 2.1从72.1涨到87.9,直接逼近Claude Fable 5的88.0,DeepSWE从12.8直接跳到62.7,Cybergym从52.7升到83.3。[10]

截止目前,V4-Pro-0813仍未涨价,每百万token缓存命中输入价为0.025元,缓存未命中输入价为3元,输出价为6元[4],作为对照,Anthropic官方价格页显示,Claude Fable 5的标准API价格为每百万token普通输入10美元、缓存命中输入1美元、输出50美元[12]。

对于Agent而言,真正重要的也不只是token单价。长程任务往往需要多轮推理、工具调用、上下文读取和失败重试,企业最终衡量的将是“完成一次有效任务要花多少钱”。

DeepSeek正在做的,是在高性能基础上持续压低这条成本曲线。


微信WeLM:不冲榜,先抢真实任务入口

微信的路线与前三家不同。8月12日,微信官方披露原生AI助手“小微”正面向有限用户测试,支持文字和语音交互[5]。同一时期,微信AI团队的WeLM-HD4-80B与WeLM-HD4-617B再次引发讨论[11]。

其中,80B模型总参数为800亿,每个token激活约30亿参数,定位微信原生AI助手,有聊天与搜索/调用微信原生功能/访问小程序服务三个能力入口。

617B模型总参数为6170亿,每个token激活约230亿参数[11],定位增强通用理解与推理,“用中等激活参数办复杂事”,主要面向智能小程序开发/小微工具生成。

这条技术路线强调资源效率,而微信真正独特的优势则在于原生生态:聊天、公众号、小程序、支付与企业服务,都可能成为Agent理解需求、调用服务并完成任务的入口。

微信大模型不强调在榜单上夺冠,其重心是AI能够自然进入用户原有的沟通和办公链路,进入真实的用户使用和公司经营环节。


同质化竞争结束,争夺Agent产业链生态位正式开始

把四家的动作放在一起看,分工已经相当清晰:xAI试图拓展长程Agent的能力上限;阿里通过开放权重争夺开发者与部署生态;DeepSeek继续压低模型调用和任务执行成本;微信则把AI嵌入聊天、办公与服务入口。

同质化的粗放竞争已经难以创造新优势

接下来真正能站稳脚跟的,可能是极致的低价、极致的专业、极致的稳定,也可能是极致的生态融合

这也意味着,大模型正在进入更真实的生产环节。未来的竞争将围绕Agent与长程任务能力、MoE架构与推理效率、工具调用、部署成本和应用生态全面升级

大模型在同质化内卷之余,争夺Agent生产力之战正式开始


参考文献

[1] SpaceXAI. Introducing Grok 4.6[EB/OL]. (2026-08-12)[2026-08-13].

[2] Qwen Team. Qwen3.8-Max[EB/OL]. (2026-08-02)[2026-08-13].

[3] Qwen Team. Qwen3.8-2.4T-A95B[EB/OL]. (2026-08-12)[2026-08-13].

[4] DeepSeek. 模型与价格[EB/OL]. [2026-08-13].

[5] WeChat. 关于微信原生AI助手“小微”的帖子[EB/OL]. (2026-08-12)[2026-08-13].

[6] SpaceXAI. Grok 4.6模型文档[EB/OL]. (2026-08-12)[2026-08-13].

[7] Arena. Leaderboard Changelog[EB/OL]. (2026-08-12)[2026-08-13].

[8] Arena. Leaderboard[EB/OL]. [2026-08-13].

[9] Arena. Code Arena[EB/OL]. [2026-08-13].

[10] StatsWire. 关于DeepSeek V4-Pro-0813基准成绩的帖子[EB/OL]. (2026-08-12)[2026-08-13].

[11] WeChat AI Team. Hidden Decoding at Scale[J/OL]. arXiv, 2026[2026-08-13].

[12] Anthropic. Pricing: Claude Fable 5[EB/OL]. [2026-08-13].

最新发布