跟踪 2025.12-2026.09 AI 领域的最新动态:模型发布、论文进展、开源项目、行业动态。
可能改变行业格局的里程碑事件
Anthropic 推出 Claude Opus 5.5,定位为 Fable 5.1 级工作能力但成本比 Opus 5 低 40%,在多项基准测试中排名第一。
OpenAI 发布 GPT-6 Astra,Greg Brockman 称'欢迎进入 AGI 时代'。ARC-AGI-3 得分 99.9,为 OpenAI 迄今最智能、最对齐的模型,9月3日限组织开放、9月4日全面可用,API 文档引导开发者从此版本起步。
DeepSeek 发布 V4 系列(1.6T 参数 MoE 架构),V4-Flash 主打低延迟,并宣布永久定价策略。
Meta 发布 Muse Spark,从开源 Llama 转向闭源路线,定位为个人超级智能模型。
总参数 2.8 万亿,原生多模态理解 + 百万 Token 长上下文,面向复杂推理、长程编程与知识工作,7 月 27 日开放权重。
SGLang 全球部署超 40 万 GPU,RadixAttention 等技术使其在生产环境领先。
从 9000 stars 暴涨至 30 万+,个人 AI Agent 自部署现象级项目,衍生出 AI Agent 社交网络 Moltbook。
全球风投 Q1 2026 达 $297B,其中 AI 占 $242B(80%),OpenAI $122B 为史上最大融资轮。
MCP 成为 Agent-Tool 连接标准,A2A 成为多智能体互操作标准,50+ 公司支持。
新模型与版本更新
月之暗面推出 Kimi K2.8 Preview 版本,在长上下文与推理能力上继续迭代,为后续正式版做准备。
xAI 于 9 月 21 日发布 Grok 4.7,上下文窗口扩展至 50 万 token,重点强化代码生成与智能体任务执行能力。
新版 Copilot 将 Office 应用直接嵌入,新增 Code 和 Autopilot 能力,从对话工具扩展为可执行任务、构建应用的智能代理。
125B 参数(6B 激活)+ 51B N-gram 多模态 MoE,编码/办公/Agent 基准超越 Qwen3.7-Plus,训练成本仅 1/9,开放权重。
GPT-6 Sol 专注自主编程 Agent、多工具协作工作流和低成本大规模自动化,是 OpenAI Agents API 的核心模型。
Anthropic 推出 Claude Opus 5.5,定位为 Fable 5.1 级工作能力但成本比 Opus 5 低 40%,在多项基准测试中排名第一。
实时音视频交互,多通道音频和远程MCP工具调用。
DeepSeek V系列最小模型,支持1M上下文,新增原生视觉理解。
编码和Agent任务能力显著提升,价格与前代持平。
Claude 最新旗舰模型,延续终端Agent和编码能力优势。
GPT-6 Sol 定位日常专业工作和编码,API价格较GPT-5.6减半;Luna 是最低成本模型,面向高频场景。
DeepSeek 发布 V4.1 Flash,新上榜即登顶 LMArena 代码能力榜第一。同期 GPT Image 2.5、Grok 4.6 也发布。
Gemini 3.8 Live 与 3.8 Live Extended Thinking 上线 Gemini API,原生语音对语音模型,音频输入 $0.005/分钟、输出 $0.018/分钟。Extended Thinking 以 82.6 分居 Artificial Analysis 语音质量指数第一,接入 Gemini Live/Search Live/Workspace。
Anthropic 发布 Claude Opus 5.5,在达到 Fable 5.1 同级能力的同时定价低于 Opus 5,进一步压缩旗舰模型使用成本。
OpenAI 在 Astra 之下扩展 GPT-6 产品线,发布均衡档 Sol 和轻量档 Luna,API 价格为上一代同档的一半且永久生效。三档分工延续 Sol/Terra/Luna 策略。
OpenAI 发布 GPT-6 Astra,Greg Brockman 称'欢迎进入 AGI 时代'。ARC-AGI-3 得分 99.9,为 OpenAI 迄今最智能、最对齐的模型,9月3日限组织开放、9月4日全面可用,API 文档引导开发者从此版本起步。
科大讯飞词元星火推出并开源星火 X2.5-4B 和 X2.5-1.7B 两款端侧通用大模型,是端侧模型中唯一原生支持最长 100 万 Token 上下文的模型。昇腾 AI 基础软硬件为两款模型提供原生训练推理全流程支持。
NVIDIA 推出 Nemotron-Nano-9B-v2 小语言模型,主打效率和灵活性,支持可切换的 AI 推理模式,面向资源受限场景。
据华尔街日报报道,谷歌即将发布 Gemini 3.8 Flash(内部代号 Skimaki),最早当地时间周三上线,主打编程能力大幅升级,追赶 OpenAI 与 Anthropic。
Anthropic 发布新一代旗舰模型 Fable 5.1,同时推出 Mythos 5.1。重点优化 Agent 连续运行数小时的能力,支持自主规划步骤、多工具调用、出错后继续执行。API 定价输入 $10/M token、输出 $50/M token,典型任务成本降低 25%,工具调用频繁的 Agent 任务成本最高降低 45%。
DeepSeek 发布 V4 系列(1.6T 参数 MoE 架构),V4-Flash 主打低延迟,并宣布永久定价策略。
OpenAI 发布 GPT-5.5,在推理、编码、数学任务上相比 GPT-5.4 有显著提升,同时推出 Workspace Agents 功能。
Anthropic 同时发布 Opus 4.7 和新层级 Mythos(10T 参数),刷新多个 benchmark 记录。
Meta 发布 Muse Spark,从开源 Llama 转向闭源路线,定位为个人超级智能模型。
Google I/O 2026 发布 Gemini 3.5 Flash 和 Gemini Spark 主动式 AI 助手,并宣布新 AI 芯片计划。
阿里通义实验室发布 Qwen 3.7-Max,API 可用,推理性能进一步提升。
Llama 4 Scout(轻量级)和 Maverick(旗舰级)正式开源,原生多模态能力。
基座与 GLM-5.2 相同,通过极致后训练 Scaling 大幅提高智能上界,编程与网络安全能力跃迁,号称开源编程能力第一,长程能力数十倍提升。
总参数 2.8 万亿,原生多模态理解 + 百万 Token 长上下文,面向复杂推理、长程编程与知识工作,7 月 27 日开放权重。
V4-Pro 支持 1M 上下文、384K 最大输出;V4-Flash(284B/13B 激活)主打高性价比并可接入 Claude Code。首次引入峰谷计费,补齐 Agent 能力。
旗舰 Sol、均衡 Terra、轻量 Luna 三档分工,新增 max 推理强度与 ultra 多智能体并行模式。
超高强度模式以 63 分险胜 GPT-5.5(62 分),同成本持平下胜出,支持自适应推理(Adaptive Reasoning)。
前沿学术研究
让模型在生成答案后再解释推理过程,在 88% 的场景中平均提升 28%,且不增加延迟。
提出元认知-inspired RL 框架,通过知识和调控信号引导 LLM 推理。
利用 LLM 自动发现策略来提升其他 LLM 的推理能力,探索测试时扩展。
自组织记忆操作系统,支持结构化长程推理,Hugging Face 5 月趋势榜 91 upvote。
Position paper:推理不应只看 CoT 输出,而应研究为隐状态轨迹形成。
开源工具与框架进展
Linux Foundation 公布 Agent-to-Agent 协议成绩单,AWS/Google/IBM/Microsoft/Salesforce 等巨头加入,成为智能体间通信标准。
SGLang 全球部署超 40 万 GPU,RadixAttention 等技术使其在生产环境领先。
vLLM 最新稳定版,包含 DeepSeek V4 支持和多项 Continuous Batching 优化。
OpenAgents 成为首个开箱即用支持 MCP 和 A2A 双协议的 Agent 框架。
LLM 推理资源合集持续更新,涵盖量化、分布式、benchmark 等方向。
从 9000 stars 暴涨至 30 万+,个人 AI Agent 自部署现象级项目,衍生出 AI Agent 社交网络 Moltbook。
提供前端开发、UI 设计、营销运营等 55 个 AI Agent 角色,支持 Claude Code 等多种工具,助力"一人公司"。
视觉化/低代码构建器主导 Agent 框架 star 排行前三,Agentic 开发平民化加速。
投融资、政策、市场格局
一只合伙企业拟设立总额不超过 60 亿元的投资基金,重点投向人工智能和半导体领域的优质未上市股权。
为迎战 Meta Muse,OpenAI 据悉将在 9 月 29 日开发者大会推出常驻个人 AI 助手“o”,相关品牌标识已出现在 ChatGPT Pro 文档中。
最新一周中国大模型调用量排名中,DeepSeek V4.1 Flash 以 19.6 万亿 Token 连续居首(环比+24%),智谱 GLM 5.3 Flash 第二,腾讯 Hy4 preview 第四。
华平投资宣布将 AI 作为新投资和投后价值创造的强制视角,嵌入投资流程每个阶段,反映 AI 已成 PE 行业标配。
AI 数据公司 Snorkel AI 完成 3.5 亿美元 E 轮融资,估值达 35 亿美元,定位为 AI 数据前沿实验室。
据 The Information,DeepSeek 创始人披露公司年化营收已达 10 亿美元,正推进第二轮融资;核心团队新增前高瓴创投合伙人严文韬任 CFO,冲刺 IPO 信号明显。
高盛预计超大规模云服务商资本支出增速将从今年近 100% 放缓至 2027 年的 54%,2028 年进一步降至 12%,届时规模约 1.4 万亿美元。
原生物理 AI 公司息壤开物连续完成种子轮及天使轮融资,敦鸿资产领投,多家机构跟投,估值达 5 亿美元,用于物理 AI 模型预训练与数据建设。
AI 云计算企业 Nscale 通过可转换票据融资 33.6 亿美元,Third Point 领投,英伟达承诺额外投入 10 亿美元,合同总价值超 1030 亿美元。
微软宣布投入超百亿美元扩展中东地区的云计算与 AI 基础设施,反映全球 AI 算力需求持续扩张。
2026 云栖大会上,平头哥发布新一代训推一体 AI 芯片真武 V900,可满足万亿参数模型的训练与推理需求。
CleanSpark 旗下 CSDC Finance 完成 7.875% 优先担保债券私募发行,资金用于扩建 AI 数据中心基础设施。
费米宇宙推出全球首款全链路量子增强大模型,种子轮为国内 Q4AI 赛道最大规模,核心团队来自清华和杨振宁高等研究院。
鼓励金融机构使用 AI 优化智能营销与全渠道服务,深化场景应用,推动金融业大模型部署落地。
计划提出三年培育 AI 科技型中小企业 1 万家以上,发挥国家 AI 产业投资基金引导作用,构建覆盖种子期到成长期的耐心资本体系。
由特斯拉 Dojo 前核心团队创立的 DensityAI 计划募资数亿美元,投后估值达 100 亿美元,已获得多家云厂商订单承诺。
9月23-24日岳麓大会在长沙举办,总规模 100 亿元的金芙蓉达晨未来产业基金落地湘江新区,首期 30 亿重点投向人工智能、生命工程、量子科技、前沿材料。68 家企业 156 件展品参展。
工信部印发计划,三年内在行业应用、数据服务、智能算力等领域新培育科技和创新型中小企业 1 万家以上,专精特新'小巨人'突破 2000 家,利好'一人公司'和智能原生企业。
Akamai 宣布与 Anthropic 扩大合作,达成七年期 116 亿美元合同承诺,依托 Akamai Cloud 分布式 AI 基础设施满足 Anthropic 持续攀升的 CPU 工作负载需求。协议预留额外最高 90 亿美元扩展空间,潜在总额约 200 亿美元。
影眸科技发布世界生成模型 Hyper3D WorldGen,上传场景图片即可自动生成独立 3D 资产。同日 3D 大模型公司 VAST 宣布完成约 30 亿元 B 轮/B+ 轮融资,发布 Tripo P2.0,首次实现原生四边面拓扑网格端到端生成。AI 3D 开启场景竞赛,迎来产业化分水岭。
Box CEO Aaron Levie:开源权重基础模型能力快速提升、后训练基础设施日益成熟商业化,拥有大量数据的企业现在可以合理地训练自己的模型,无需在研究层面与前沿实验室竞争。通用前沿模型仍在广泛任务上领先,但垂直领域模型数量将大幅增长。
全球风投 Q1 2026 达 $297B,其中 AI 占 $242B(80%),OpenAI $122B 为史上最大融资轮。
OpenAI 正式提交 IPO 申请,预计年内上市,将成为 AI 领域最大 IPO。
Anthropic 警告五角大楼禁令可能损失数十亿,同时承诺在 Amazon 投资下 10 年投入 $1000 亿。
AI 芯片公司 Cerebras 正式上市,被视为 2026 年 AI 基础设施领域最大 IPO。
SpaceX 宣布与 Cursor 战略合作并拥有 $600 亿收购期权,AI 编程工具估值创新高。
中国以数据安全为由阻止 Meta 收购 AI Agent 公司 Manus,成为首起 AI Agent 跨国收购被阻案例。
Meta 与 NVIDIA 宣布长期基础设施合作,部署百万级 GPU,2026 年资本支出 $115-135B。
Gartner 预测到 2028 年,可解释 AI 将驱动 50% 的 GenAI 部署投资用于可观测性。
投后估值有望达 180 亿美元,投资方包括 CPE 源峰、国方创投、BlueFive 等,AI 视频赛道进入商业化竞速。
对比 2025 年同期 3862 起 / 2085.8 亿元金额近乎翻倍;资金加速流向 AI 软件应用与物理 AI(具身智能、智能驾驶),早期融资占比 64.6%。
2026 上半年国内具身智能及机器人领域 288 起融资、226 家企业、274 家投资机构参与。
FPV Ventures 合伙人 Nikunj Kothari 预判:大模型实验室之间的价格战不可持续,补贴性 token 价格将在 6 个月内上涨。
FirstMark 合伙人 Matt Turck:所有前沿 AI 实验室都在做同一件事——AI 构建 AI 的递归自我改进(RSI)。
Box CEO Aaron Levie:开源权重基础模型能力快速提升、后训练基础设施日益成熟,企业用开源模型替代闭源 API 的门槛正快速下降。
Vercel CEO Guillermo Rauch:编码 token 的消耗已具基础设施属性,但多数企业仍用临时方式采购和管理,缺乏容量规划与成本治理。
Nan Yu 宣布离开 Linear 加入 OpenAI 做 Codex 与 ChatGPT,头部产品人才向编程 Agent 集中。
推理引擎、硬件、部署方案
DeepSeek 于 9 月 10 日退役 V4-Flash,V4.1 Flash 周调用量达 19.6 万亿 Token 连续两周全球第一,模型名统一为 deepseek-flash。
持续快速迭代,cu130 wheel 更新。
架构重构,V2成为所有模型默认运行环境,推理性能提升。
NVIDIA 发布 vLLM 容器 25.09,首次带来针对 NVIDIA GPU 的专属优化,兼容 CUDA 13.0。
SGLang v0.5.20 正式版发布(9月18日上传 PyPI), nightly 已迭代至 0.5.20.dev,持续跟进 Blackwell 和 ROCm kernel 融合优化。
vLLM v0.30.0 引入 GPU weight cache,量化后权重常驻显存,引擎重启时直接映射而非从磁盘重新加载,大幅缩短冷启动时间。
vLLM v0.29.0 发布,Model Runner V2 正式成为所有模型的默认运行环境,标志着 vLLM 新一代引擎架构完成迁移。同期修复了不兼容 LoRA 适配器静默加载的 bug。
Vercel CEO Guillermo Rauch 指出:coding token 已成为基础设施,但多数企业仍用临时方式采购管理,缺乏容量规划与成本治理。Vercel AI Gateway 推出 per-key 和 per-user 预算功能,类比 AWS 密钥治理来管理 AI token 消耗。
vLLM 发布安全修复:限制 validation-error 响应体大小,防止潜在 DoS 攻击。同时新增 AutoRound 格式的 block-wise FP8 支持,实现量化感知推理。同期 llama.cpp 和 SGLang 推送了 Blackwell 和 ROCm 的 kernel 融合优化。
最新对比:vLLM 在密集模型上吞吐略高,SGLang 综合性能更强,Triton 在特定场景有优势。
MAX 由 Modular 开发,在 vLLM 和 SGLang 之外成为新兴的第三选择,主打编译器优化。
Google I/O 2026 宣布新一代 TPU 和推理专用芯片计划,降低对 NVIDIA GPU 的依赖。
Meta 公布自研 MTIA 芯片路线图,四年四代,用于推荐系统和推理工作负载。
来自 212 位贡献者(61 位新人),完整支持新 Inkling model family。
vLLM Ascend 子项目发布 v0.18.0,昇腾 NPU 推理支持正式化,国产芯片推理生态里程碑。
8 月 24-26 日举办;同期博客发布 AMD GPU 投机解码实践、Ray Direct Transport 分片权重传输、扩散 RL 加速等。
v0.27.0(8-10)重点新增 Kimi K3 模型全栈支持,v0.27.1 补丁(8-11)后 v0.28.0(8-26)跟进,迭代节奏保持每 2-3 周一版。
Agent 框架、协议、产品化
Arcade.dev 重建 Microsoft Outlook 工具包,新增 Snowflake 工具包,优化 Calendly 和 Airtable 的 Agent 调用体验。
结合 MCP 实时实验数据、工程师审批、独立 Git Worktree、并行 Agent 和自动验证,50 个测试中 45 个生成可用 PR。
开发者可通过 API 运行云端 Agent,平台负责会话编排和上下文管理,支持 MCP、自定义函数、多 Agent 工作流。
Amazon Bedrock 生态新增托管服务,作为 AI Agent 跨多个 AWS 账号调用工具和资源的集中代理,原生支持 MCP 协议。
智能体从单一走向协作生态,LangGraph/AutoGen/CrewAI推动多Agent标准。
多Provider LLM、工具集成和编排,含Human-in-the-Loop审批。
托管Agents API,提供Codex同款会话编排和沙箱,支持MCP和多Agent委派。
DeepMCP/DeepMCPAgent 开源,提供零代码 MCP 智能体启动器、100+ 预配置 MCP 服务模板、LangChain/LangGraph 集成示例和企业级部署方案,MIT 协议。Gitee 提供国内镜像。
DeepSeek 最新论文公开 DSec(DeepSeek Elastic Compute)系统,专为 Agent 训练构建高并发沙盒环境。每秒生成超 5000 个沙盒,日产能 300 万个,峰值支持 38 万沙盒并行,解决 Agent 训练依赖高质量多样化仿真环境的核心瓶颈。梁文锋署名。
网易游戏互动娱乐事业群启动企业级 AI Agent Infra 平台建设,目标将 Agent 的运行、编排、工具、记忆、安全等通用能力平台化,降低业务构建 Agent 的成本。招聘 AI 平台研发工程师(Agent Infra 方向)。
Vercel CEO Guillermo Rauch 宣布:下一个设计系统是 Markdown。DESIGN.md 帮助解决 AI 时代最难的问题——设计同质化(slop),并在大型组织中规模化设计品味。
MCP 成为 Agent-Tool 连接标准,A2A 成为多智能体互操作标准,50+ 公司支持。
LangGraph 超越 CrewAI 成为 GitHub star 最多的 Agent 框架,生产部署排名第一。
中国发布全球首个针对 AI Agent 的国家政策框架,采取先部署后治理模式。
EU AI Act 于 2026 年 8 月全面生效前,达成政治协议修订案:延迟部分合规期限、简化要求。
OpenAI 推出 Workspace Agents 预制模板和 Codex 扩展,从编码代理走向工作空间代理。
7 月 GitHub Trending Top 10;xai grok-build 等 harness 类项目同步上榜,Agent 工具链成为趋势主题。
团队级 AI Agent 记忆中枢,将对话、文档、代码转化为共享记忆,记忆层成为 Agent 基础设施标配。