一夜四家公司密集更新,大模型竞速白热化
北京时间2026年8月12日至13日前后,AI行业迎来一个罕见的高密度更新窗口:
- xAI正式发布Grok4.6模型并同步更新API[1];
- 阿里开放Qwen3.8-2.4T-A95B权重,托管版Qwen3.8-Max也已上线[2-3]
- DeepSeek的API价格页将V4-Pro当前版本更新为0813[4];
- 微信原生AI助手“小微”进入有限用户测试,WeLM也再次受到关注[5]。
这个密度,过去一年都少见。
xAI:让Agent把长任务真正跑起来
xAI于8月12日发布Grok4.6,并将其接入Cursor、Grok Build、xAI API及多家第三方平台。
模型支持文本和图像输入,提供50万token上下文与可调节的推理强度;短上下文基础价格为每百万token输入2美元、输出6美元[1,6]。
Grok4.6的补充训练加入了工程数据、由前代模型生成的推理轨迹,以及面向知识工作、编码、网页开发和CAD等任务的强化学习。按照xAI的产品定位,它要处理的已经不只是一次问答,而是跨代码库工程、研究分析、办公产物,以及从想法到应用的多步流程[1]。
这意味着,模型竞争的评价单位正在发生变化:过去比的是一道题答得对不对,现在比的是几十步任务能否持续推进,遇到错误能否恢复,最终产物能否真正交付。
阿里:把Max级权重交给开发者生态
Qwen3.8-Max于8月2日正式公布;8月3日,API服务全面上线;8月12日,阿里又补上关键一步——开放Qwen3.8-2.4T-A95B权重[2-3]。
作为通义千问系列中尺寸最大、性能最强的模型,Qwen3.8-Max采用了MoE(混合专家模型)架构。虽然其总参数量高达2.4万亿,但通过稀疏激活机制,单次推理仅需激活约950亿参数。
这种设计在保证大模型处理能力的同时,大幅降低了计算资源的消耗。此外,该模型支持100万token的上下文窗口,并原生支持多模态视觉能力。
按8月3日前后的榜单,Qwen3.8-Max在Text Arena中排名全球第五,在Vision Arena中排名全球第二;在Code Arena的编程评测中排名全球第四[7-9]。
DeepSeek:用逼近Fable 5性能和极低价格定义新的斩杀线
与此同时,DeepSeek在官网API文档里悄然上线了V4-Pro-0813。[4]
首批社区流传的评测认为,从预览版到正式版,它的Agent基准成绩全面跳涨:Terminal Bench 2.1从72.1涨到87.9,直接逼近Claude Fable 5的88.0,DeepSWE从12.8直接跳到62.7,Cybergym从52.7升到83.3。[10]

截止目前,V4-Pro-0813仍未涨价,每百万token缓存命中输入价为0.025元,缓存未命中输入价为3元,输出价为6元[4],作为对照,Anthropic官方价格页显示,Claude Fable 5的标准API价格为每百万token普通输入10美元、缓存命中输入1美元、输出50美元[12]。
对于Agent而言,真正重要的也不只是token单价。长程任务往往需要多轮推理、工具调用、上下文读取和失败重试,企业最终衡量的将是“完成一次有效任务要花多少钱”。
DeepSeek正在做的,是在高性能基础上持续压低这条成本曲线。
微信WeLM:不冲榜,先抢真实任务入口
微信的路线与前三家不同。8月12日,微信官方披露原生AI助手“小微”正面向有限用户测试,支持文字和语音交互[5]。同一时期,微信AI团队的WeLM-HD4-80B与WeLM-HD4-617B再次引发讨论[11]。
其中,80B模型总参数为800亿,每个token激活约30亿参数,定位微信原生AI助手,有聊天与搜索/调用微信原生功能/访问小程序服务三个能力入口。
617B模型总参数为6170亿,每个token激活约230亿参数[11],定位增强通用理解与推理,“用中等激活参数办复杂事”,主要面向智能小程序开发/小微工具生成。
这条技术路线强调资源效率,而微信真正独特的优势则在于原生生态:聊天、公众号、小程序、支付与企业服务,都可能成为Agent理解需求、调用服务并完成任务的入口。
微信大模型不强调在榜单上夺冠,其重心是AI能够自然进入用户原有的沟通和办公链路,进入真实的用户使用和公司经营环节。
同质化竞争结束,争夺Agent产业链生态位正式开始
把四家的动作放在一起看,分工已经相当清晰:xAI试图拓展长程Agent的能力上限;阿里通过开放权重争夺开发者与部署生态;DeepSeek继续压低模型调用和任务执行成本;微信则把AI嵌入聊天、办公与服务入口。
同质化的粗放竞争已经难以创造新优势。
接下来真正能站稳脚跟的,可能是极致的低价、极致的专业、极致的稳定,也可能是极致的生态融合。
这也意味着,大模型正在进入更真实的生产环节。未来的竞争将围绕Agent与长程任务能力、MoE架构与推理效率、工具调用、部署成本和应用生态全面升级。
大模型在同质化内卷之余,争夺Agent生产力之战正式开始。
参考文献
[1] SpaceXAI. Introducing Grok 4.6[EB/OL]. (2026-08-12)[2026-08-13].
[2] Qwen Team. Qwen3.8-Max[EB/OL]. (2026-08-02)[2026-08-13].
[3] Qwen Team. Qwen3.8-2.4T-A95B[EB/OL]. (2026-08-12)[2026-08-13].
[4] DeepSeek. 模型与价格[EB/OL]. [2026-08-13].
[5] WeChat. 关于微信原生AI助手“小微”的帖子[EB/OL]. (2026-08-12)[2026-08-13].
[6] SpaceXAI. Grok 4.6模型文档[EB/OL]. (2026-08-12)[2026-08-13].
[7] Arena. Leaderboard Changelog[EB/OL]. (2026-08-12)[2026-08-13].
[8] Arena. Leaderboard[EB/OL]. [2026-08-13].
[9] Arena. Code Arena[EB/OL]. [2026-08-13].
[10] StatsWire. 关于DeepSeek V4-Pro-0813基准成绩的帖子[EB/OL]. (2026-08-12)[2026-08-13].
[11] WeChat AI Team. Hidden Decoding at Scale[J/OL]. arXiv, 2026[2026-08-13].
[12] Anthropic. Pricing: Claude Fable 5[EB/OL]. [2026-08-13].

闫文清
关注:科技
邮箱:wenqingzzz1169@gmail.com




