AI 大模型日报(2026-08-28)
📅 日期:2026 年 8 月 28 日(星期五)
🔍 数据来源:网络公开资讯整理(DeepSeek API 文档 / Z.ai 官方博客 / Google Blog / LLM Stats / LLM Rank / Fortune / Zapier / 知乎专栏 / Google Cloud 报告 等)
一、今日热点速览
# 热点 一句话摘要
1 GLM-5.3-Flash 正式发布 Z.ai 推出首个原生多模态 GLM-5 模型(320B/18B MoE、1M 上下文、MIT 权重),列表价 0.15/
0.15
/
0.50,8/26 起 50% 促销
2 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek 首个官方视觉多模态模型(8/21),纯文本能力与 V4-Flash 持平,多模态 Agent 能力接近 Opus-4.8
3 Qwen3.8-Flash-Next 开源预览 Qwen4 架构的开源权重预览版(8/25),仅 6B 激活参数、262K 原生上下文,自报 DeepSWE 58.7
4 阿里 WAN 3.0 视频模型发布 单次生成最长 30 秒 1080p 带音频视频(8/23),fal 平台按秒计费低至 $0.05
5 DeepSeek V4-Pro 正式版满月 8/13 升级 Agent 能力(Terminal Bench 2.1 达 87.9)、原生支持 Responses API、适配 Codex,8/17 起施行峰谷定价
6 谷歌 7 月 AI 更新盘点 发布 Gemini 3.6 Flash / 3.5 Flash-Lite / 3.5 Flash Cyber 与 Gemini Robotics ER 2,Gemini Notebook 全面整合进 Gemini App 与搜索
7 2026 被定义为"AI Agent 规模化商用元年" Google Cloud《AI Agent 趋势报告》:37% 制造企业已部署 10+ 智能体,Agent 从实验室走向企业核心流程
二、各重要模型动态
🟢 OpenAI — GPT 系列
GPT-5.6 家族(Sol / Terra / Luna) 仍是当前闭源旗舰系列:8/21 起 GPT-5.6 Sol 价格再降 20%+(为期 3 个月),7/30 已降 Luna 80%、Terra 20%,延续"以价换量"策略。根据 LLM Stats 厂商目录,OpenAI 当前 API 在售模型达 69 个,输入价格区间 0.10–0.10–12.50/百万 token,其中安全向的 GPT-5.6 Cyber 定价 $1250/百万 token(面向高端安全场景的极高溢价档位)。
GPT-5(2025 年 8 月发布,400K 上下文)采用 gpt-5-main / gpt-5-thinking 路由双模型架构,安全范式从"硬性拒答"转向"安全补全"(safe-completions),幻觉率较 GPT-4o 下降 26%、较 o3 下降 65%——此架构思路持续影响后续版本迭代。
🟡 Anthropic — Claude 系列
Claude Opus 5 为当前 API 目录中最强档位,LLM Stats 显示定价 500/百万𝑡𝑜𝑘𝑒𝑛(输出端),主打复杂推理与长程𝐴𝑔𝑒𝑛𝑡任务;𝑂𝑝𝑢𝑠4.8仍以
500/百万(输出端),主打复杂推理与长程任务;4.8仍以5/$25 的价格卡位工程编码市场。
生态侧:8/26 与 Salesforce 联合发布 Claudeforce,把 Claude 接入企业销售工作流;与 Nscale 达成 450 亿美元算力合作,算力储备持续加码。行业评测中,DeepSeek-V4-Flash-Vision-Exp 的多模态 Agent 能力已被官方对标"接近 Opus-4.8",Claude 在视觉 Agent 赛道面临国产模型追赶。
🔵 Google DeepMind — Gemini 系列
7 月密集更新盘点(官方 8/4 Recap):
发布 Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber 三款面向生产级 Agent 的高效模型,主打更高 token 效率、更低延迟;
Gemini Robotics ER 2:迄今最强"具身推理"模型,支持自然对话、环境理解与多步物理世界任务;
Gemini Notebook(原 NotebookLM)整合进 Gemini App 与 Google 搜索,并新增安全云电脑;
AlphaEvolve(Gemini 驱动的代码优化 Agent)对全部 Google Cloud 客户开放;Gemini Spark 扩展至更多地区,可代用户完成网页差事。
Gemini 3.7 Flash(8/12 发布):DeepSWE v1.1 达 65.3%、1M 上下文、0.75/0.75/3.75 定价(2027 年初列表价将翻倍,处低价窗口期);在 BabyVision 等视觉基准上仍是 GLM-5.3-Flash(53.4)等竞品追赶的目标(70.9)。
前沿旗舰 Gemini 3.1 Pro(2/19 预览版)继续对标 GPT-5.x 与 Claude 旗舰。
🟣 Meta — Llama / Muse 系列
开源旗舰仍为 Muse Spark(2026 年 4 月发布),Llama 4 系列维持多模态开源基本盘,但近期声量被 DeepSeek / Qwen / GLM 的快速迭代压制;Meta 在本轮 Flash 轻量级价格战中暂无新动作。
🔴 DeepSeek — V4 系列(近期迭代最密集的厂商之一)
8 月 21 日:DeepSeek-V4-Flash-Vision-Exp 发布——V4-Flash 首个官方视觉多模态实验版,调用名 deepseek-v4-flash-vision-exp:
关键基准:Terminal Bench 2.1 83.9、NL2Repo 57.7、DeepSWE 59.3、DSBench-Hard 63.6、AutomationBench 25.7、ApexBench 36.5、Agents’ Last Exam 27.3、Chartography 64.3、ZeroBench 35.0;
纯文本能力与 V4-Flash 正式版持平;在需要视觉理解的 Agent 基准上大幅跃升,多模态 Agent 能力已接近 Opus-4.8。
8 月 13 日:V4-Pro 正式版——Agent 能力大幅增强:Terminal Bench 2.1 87.9、NL2Repo 61.5、Cybergym 83.3、DeepSWE 62.7、Toolathlon-Verified 74.1、DSBench-FullStack 71.1;原生支持 OpenAI Responses API 并针对性适配 Codex(一键配置脚本);思考模式支持 low / high / max 三档强度。
8 月 17 日起施行峰谷定价:闲时价格为高峰时段一半,引导用户错峰使用,是国产厂商中率先推行动态定价的代表。
🟠 智谱 AI — GLM 系列(本周最大开源新闻)
GLM-5.3-Flash(8/26 发布,此前以 ox-alpha 代号在 OpenCode / OpenRouter 隐身测试):
首个原生多模态 GLM-5:320B 总参 / 18B 激活 MoE、45 层、混合线性 + 稀疏注意力(IndexPool、mHC)、1M token 上下文,文本 + 图像 + 视频一体;视觉能力内置于编码循环(自视觉判断),而非外挂 VL 头;
30T 多模态预训练;相对文本版 GLM-5.3,注意力算力约省 3.0×、KV 缓存约省 4.4×;
自报基准:DeepSWE 63.4(GLM-5.2 为 46.2,+17.2)、AutomationBench 48.8(+22.6)、Toolathlon 78.4、Terminal Bench 2.1 84.3、NL2Repo 56.3;视觉:OfficeQA-Pro 62.4、CharXiv 89.4、Chartography 78.0、MVBench 77.8(BabyVision 53.4 落后于 Gemini 3.7 Flash 的 70.9);MIT 协议权重托管于 Hugging Face(zai-org/GLM-5.3-Flash);列表价 0.15/0.15/0.03 缓存 / $0.50,8/26 起 50% 促销至 9/9 16:00 UTC;与文本旗舰 GLM-5.3(753B、1.40/1.40/4.40)互为补充,输入成本约为其 1/10。
LLM Rank(8/26 更新)显示 GLM-5.3-Flash 中文定价 ¥1.08/¥3.60(百万 token),性价比位居榜单前列。
🟤 阿里巴巴 — Qwen / WAN 系列
Qwen3.8-Flash-Next(8/25):Qwen4 架构的开源权重预览版,6B 激活参数、262K 原生上下文,自报 DeepSWE 58.7、SWE-Pro 62.5——开源小模型以极低激活参数逼近旗舰级 Agent 能力,效率路线代表性产品。
WAN 3.0 视频模型(8/23):单次生成最长 30 秒 1080p 带音频视频,fal 平台按秒计费 0.05/0.05/0.10/0.20,𝑃𝑟𝑖𝑚𝑒加速档0.20,加速档0.068/0.14/0.14/0.28,视频生成进入"长时长 + 有声"时代。
闭源旗舰 Qwen3.8-Max 位列国产闭源第一梯队(LLM Stats 目录价 $165/百万 token)。
⚪ xAI / 其他厂商
xAI Grok 4.6:当前闭源旗舰(目录价 $200/百万 token),2M 上下文上限。
IBM Granite 4.2(8/25 上线 LLM Rank):3B / 8B 小模型,超低价(¥0.22 / ¥0.43 输入),主打企业本地化部署。
月之暗面 Kimi、MiniMax M3($30/M)、小米 MiMo、Cohere Command、Amazon Nova、Mistral(Medium 3 / Magistral)等继续在性价比与垂直场景卡位。
生态总量:LLM Stats 统计在售模型已超 500 个,覆盖 50+ 基准评测,模型供给进入"琳琅满目"阶段。
三、行业趋势分析
1. 多模态 Agent 成为竞争主战场
DeepSeek 视觉版"Agent 能力接近 Opus-4.8"、GLM-5.3-Flash 把视觉内嵌进编码循环、Gemini Robotics ER 2 进军具身推理——"看得见的 Agent"取代纯文本聊天成为下一代能力分水岭。Chartography、OfficeQA-Pro、MVBench 等视觉 Agent 基准开始频繁出现在各家发布稿中,说明多模态与 Agent 正在合流为同一场竞赛。
2. Flash 轻量级 + 动态定价掀起"每美元智能"价格战
GLM-5.3-Flash 以 1/10 价格提供多模态旗舰能力(并叠加 50% 促销)、DeepSeek 率先施行峰谷定价、Gemini 3.7 Flash 低价窗口期、OpenAI 对 5.6 家族三连降——厂商竞争从"谁更强"转向"同样预算谁能干更多活"。轻量级激活参数(6B–18B)配合稀疏注意力成为兼顾性能与成本的主流工程路线。
3. 开源阵营以"MIT 权重 + 高性价比"双线冲击闭源
GLM-5.3-Flash(MIT 协议、原生多模态、1M 上下文)、Qwen3.8-Flash-Next(Qwen4 架构开源预览)、DeepSeek 系列全量开源——开源模型在多模态与 Agent 能力上正逼近闭源旗舰,免费商用策略持续压缩闭源厂商溢价空间,企业自部署(如 IBM Granite 本地化)需求同步上升。
4. 2026 被定义为"AI Agent 规模化商用元年"
Google Cloud《AI Agent 趋势报告》指出:37% 制造企业已部署超过 10 个智能体,用于 OEE 优化、预测性维护、供应链管理等复杂流程;北美制造业主流从静态自动化转向能持续学习、自主决策的多 Agent 系统。AI Agent 正在从"技术演示"进入企业核心流程,成为人机协同的核心载体。
5. 视频生成进入"长时长 + 有声"新阶段
阿里 WAN 3.0 单次 30 秒 1080p 带音频生成,配合按秒计费的低价策略,视频生成从"几秒片段"迈向"可直接成片",内容生产工具的边际成本进一步下探,多模态大模型的应用场景从办公延伸至营销、影视与社交内容。
6. Agent 基准主导评测叙事
DeepSWE、Terminal Bench 2.1、AutomationBench、NL2Repo 等工程/智能体基准取代传统问答榜成为旗舰发布稿的必争数据;GLM-5.3-Flash 与 DeepSeek 视觉版的核心卖点均为 Agent 相关指标——"能连续工作数小时的数字员工"是各厂共同的叙事终点,测试框架(如 DeepSeek Harness)与评测口径的标准化之争也随之升温。
四、参考来源
DeepSeek API 官方文档:更新日志(2026-08-21 Vision-Exp / 2026-08-13 V4-Pro / 2026-07-31 V4-Flash 正式版)
Z.ai 官方博客:GLM-5.3-Flash 发布(2026-08-26);LLM Stats:GLM-5.3-Flash 发布分析 / Qwen3.8-Flash-Next / WAN 3.0 / AI Updates Today / API Provider 目录
Google Blog:The latest AI news we announced in July 2026(2026-08-04 盘点)
LLM Rank(llmrank.cn):2026-08-26 模型排行榜更新(GLM-5.3-Flash / Granite 4.2 / DeepSeek V4 Flash Vision)
Zapier:The Best Large Language Models in 2026(2026-07-03);Fortune:GPT-5 评测与 OpenAI 商业动态
Google Cloud:《AI Agent Trends 2026》报告解读(知乎专栏);智教新媒:2026 AI Agent 技术发展报告;亿欧:《2026 中国智能体类应用洞察报告》
知乎专栏:国内外知名大模型及应用——模型/应用维度(2026/08/26)
————————————————
版权声明:本文为CSDN博主「ZRS的AI笔记」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
原文链接:https://blog.csdn.net/enheng1238/article/details/164143588