跳到主要内容
实时追踪

行业趋势

跟踪 2025.12-2026.09 AI 领域的最新动态:模型发布、论文进展、开源项目、行业动态。

117 条趋势9 S 级突破49 A 级重要持续更新更新于 2026-09-28

S 级重大突破

可能改变行业格局的里程碑事件

Anthropic 发布 Claude Opus 5.5:Fable 级能力成本降低 40%

S

Anthropic 推出 Claude Opus 5.5,定位为 Fable 5.1 级工作能力但成本比 Opus 5 低 40%,在多项基准测试中排名第一。

ThursdAI2026-09-24

OpenAI 发布 GPT-6 Astra:ARC-AGI-3 得分 99.9,称'欢迎进入 AGI 时代'

S

OpenAI 发布 GPT-6 Astra,Greg Brockman 称'欢迎进入 AGI 时代'。ARC-AGI-3 得分 99.9,为 OpenAI 迄今最智能、最对齐的模型,9月3日限组织开放、9月4日全面可用,API 文档引导开发者从此版本起步。

OpenAI / ThursdAI2026-09-03

DeepSeek V4 / V4-Flash 系列发布

S

DeepSeek 发布 V4 系列(1.6T 参数 MoE 架构),V4-Flash 主打低延迟,并宣布永久定价策略。

DeepSeek2026-04-24

Meta Muse Spark:首个 Superintelligence Labs 模型

S

Meta 发布 Muse Spark,从开源 Llama 转向闭源路线,定位为个人超级智能模型。

Meta AI Blog2026-04-08

Kimi K3 开源:2.8 万亿参数,全球参数量最大的开源模型

S

总参数 2.8 万亿,原生多模态理解 + 百万 Token 长上下文,面向复杂推理、长程编程与知识工作,7 月 27 日开放权重。

月之暗面 / USTC LLM 平台2026-07-17

SGLang 成为 LLM 推理事实标准(40 万+ GPU 部署)

S

SGLang 全球部署超 40 万 GPU,RadixAttention 等技术使其在生产环境领先。

GitHub Trending2026-05-01

OpenClaw 现象级爆发:GitHub 史上增长最快开源项目(30 万+ stars)

S

从 9000 stars 暴涨至 30 万+,个人 AI Agent 自部署现象级项目,衍生出 AI Agent 社交网络 Moltbook。

ByteByteGo2026-08-01

Q1 2026 创纪录:$297B 风投,AI 占 80%

S

全球风投 Q1 2026 达 $297B,其中 AI 占 $242B(80%),OpenAI $122B 为史上最大融资轮。

Crunchbase / KPMG2026-04-01

MCP + A2A 协议标准化完成,Agent 互操作进入新阶段

S

MCP 成为 Agent-Tool 连接标准,A2A 成为多智能体互操作标准,50+ 公司支持。

freeCodeCamp / Google / Anthropic2026-04-28

最新 S 级亮点

•Anthropic 发布 Claude Opus 5.5:Fable 级能力成本降低 40%(2026-09-24)
•OpenAI 发布 GPT-6 Astra:ARC-AGI-3 得分 99.9,称'欢迎进入 AGI 时代'(2026-09-03)
•OpenClaw 现象级爆发:GitHub 史上增长最快开源项目(30 万+ stars)(2026-08-01)
•Kimi K3 开源:2.8 万亿参数,全球参数量最大的开源模型(2026-07-17)
•SGLang 成为 LLM 推理事实标准(40 万+ GPU 部署)(2026-05-01)

A 级趋势速览

•OpenAI 将于 9 月 29 日发布常驻 AI 助手“o”(2026-09-28)
•中国大模型周调用量榜:DeepSeek V4.1 Flash 以 19.6 万亿 Token 居首(2026-09-28)
•阿里发布 Qwen3.8-Flash:低成本多模态 MoE(2026-09-27)
•AWS 推出 AgentCore Gateway:基于 MCP 的跨账号 Agent 网关(2026-09-26)
•微软推出新版 Copilot:Home/Code/Autopilot 三合一(2026-09-25)
•高盛:超大规模云资本支出增速 2027 年放缓至 54%(2026-09-25)
•Nscale IPO 前融资 33.6 亿美元,英伟达加投 10 亿(2026-09-25)
•AI 芯片初创 DensityAI 融资谈判后期,估值接近 100 亿美元(2026-09-25)

模型发布

32 条

新模型与版本更新

月之暗面发布 Kimi K2.8 Preview

B

月之暗面推出 Kimi K2.8 Preview 版本,在长上下文与推理能力上继续迭代,为后续正式版做准备。

东方财富研报2026-09-18
FDE 相关性:国产模型持续快速迭代,需关注部署适配

xAI 发布 Grok 4.7:50 万上下文,强化代码与 Agent 任务

A

xAI 于 9 月 21 日发布 Grok 4.7,上下文窗口扩展至 50 万 token,重点强化代码生成与智能体任务执行能力。

LeanTech2026-09-21
FDE 相关性:新模型对推理部署的上下文管理和Agent能力提出更高要求

微软推出新版 Copilot:Home/Code/Autopilot 三合一

A

新版 Copilot 将 Office 应用直接嵌入,新增 Code 和 Autopilot 能力,从对话工具扩展为可执行任务、构建应用的智能代理。

今日头条2026-09-25
FDE 相关性:企业级 Agent 平台化趋势,影响生产部署架构

阿里发布 Qwen3.8-Flash:低成本多模态 MoE

A

125B 参数(6B 激活)+ 51B N-gram 多模态 MoE,编码/办公/Agent 基准超越 Qwen3.7-Plus,训练成本仅 1/9,开放权重。

LLM Data Hub2026-09-27
FDE 相关性:低成本开源 MoE 模型,适合自部署 Agent 场景

OpenAI 发布 GPT-6 Sol:面向自主编程智能体

A

GPT-6 Sol 专注自主编程 Agent、多工具协作工作流和低成本大规模自动化,是 OpenAI Agents API 的核心模型。

tek.jp2026-09-23
FDE 相关性:编程 Agent 专用模型,影响 AI 工程工作流

Anthropic 发布 Claude Opus 5.5:Fable 级能力成本降低 40%

S

Anthropic 推出 Claude Opus 5.5,定位为 Fable 5.1 级工作能力但成本比 Opus 5 低 40%,在多项基准测试中排名第一。

ThursdAI2026-09-24
FDE 相关性:顶级模型成本持续下降,直接降低推理部署门槛

Qwen3.8-Omni-Flash-Realtime 发布

B

实时音视频交互,多通道音频和远程MCP工具调用。

Qwen Docs2026-09-21
FDE 相关性:多模态推理场景

DeepSeek V4.1-Flash 原生多模态视觉

A

DeepSeek V系列最小模型,支持1M上下文,新增原生视觉理解。

千问云2026-09-20
FDE 相关性:开源模型推理部署新选择

Google Gemini 3.8 Flash 稳定版 GA

A

编码和Agent任务能力显著提升,价格与前代持平。

Chat LLM2026-09-02
FDE 相关性:轻量级推理部署可选

Anthropic Claude Opus 5.5 发布

A

Claude 最新旗舰模型,延续终端Agent和编码能力优势。

LLM Gateway2026-09-22
FDE 相关性:Claude Code 能力升级

OpenAI GPT-6 Sol 与 GPT-6 Luna 发布

A

GPT-6 Sol 定位日常专业工作和编码,API价格较GPT-5.6减半;Luna 是最低成本模型,面向高频场景。

LLM Gateway2026-09-22
FDE 相关性:编码和推理成本下降

DeepSeek V4.1 Flash 登代码榜第一

B

DeepSeek 发布 V4.1 Flash,新上榜即登顶 LMArena 代码能力榜第一。同期 GPT Image 2.5、Grok 4.6 也发布。

DataLearner / AvalAI2026-09-11
FDE 相关性:开源/开放权重模型在代码场景持续领先,自部署代码 Agent 的基座模型新选择。

谷歌发布 Gemini 3.8 Live:原生语音对话,Extended Thinking 登顶语音质量榜

A

Gemini 3.8 Live 与 3.8 Live Extended Thinking 上线 Gemini API,原生语音对语音模型,音频输入 $0.005/分钟、输出 $0.018/分钟。Extended Thinking 以 82.6 分居 Artificial Analysis 语音质量指数第一,接入 Gemini Live/Search Live/Workspace。

Google / aitooltier2026-09-15
FDE 相关性:语音原生推理服务成为新部署品类;实时语音流对推理引擎的低延迟和流式批处理能力提出新要求。

Anthropic 发布 Claude Opus 5.5:Fable 级效果,价格低于 Opus 5

A

Anthropic 发布 Claude Opus 5.5,在达到 Fable 5.1 同级能力的同时定价低于 Opus 5,进一步压缩旗舰模型使用成本。

Anthropic / API易 / AvalAI2026-09-23
FDE 相关性:旗舰模型性价比持续提升,多模型路由策略中 Claude 档位需重新校准;Agent 工具调用成本模型更新。

OpenAI 发布 GPT-6 Sol 与 Luna:价格永久降半

A

OpenAI 在 Astra 之下扩展 GPT-6 产品线,发布均衡档 Sol 和轻量档 Luna,API 价格为上一代同档的一半且永久生效。三档分工延续 Sol/Terra/Luna 策略。

OpenAI / API易 / MaxAssistant2026-09-22
FDE 相关性:价格腰斩改变推理成本核算模型,轻量档 Luna 适合高并发低延迟场景;FDE 需重新做模型选型的性价比 benchmark。

OpenAI 发布 GPT-6 Astra:ARC-AGI-3 得分 99.9,称'欢迎进入 AGI 时代'

S

OpenAI 发布 GPT-6 Astra,Greg Brockman 称'欢迎进入 AGI 时代'。ARC-AGI-3 得分 99.9,为 OpenAI 迄今最智能、最对齐的模型,9月3日限组织开放、9月4日全面可用,API 文档引导开发者从此版本起步。

OpenAI / ThursdAI2026-09-03
FDE 相关性:GPT-6 代际跃迁直接影响推理服务选型与成本模型;ARC-AGI-3 近满分意味着 Agent 长程任务能力质变,需重新评估推理编排架构。

星火 X2.5-4B/1.7B 开源:端侧唯一百万上下文 + 昇腾原生支持

B

科大讯飞词元星火推出并开源星火 X2.5-4B 和 X2.5-1.7B 两款端侧通用大模型,是端侧模型中唯一原生支持最长 100 万 Token 上下文的模型。昇腾 AI 基础软硬件为两款模型提供原生训练推理全流程支持。

科大讯飞 / 华为计算2026-09-01
FDE 相关性:端侧百万上下文 + 昇腾原生支持,为信创端侧部署提供新选项;百万上下文对端侧 KV Cache 管理提出新挑战。

NVIDIA 发布 Nemotron-Nano-9B-v2:可切换推理模式的端侧小模型

C

NVIDIA 推出 Nemotron-Nano-9B-v2 小语言模型,主打效率和灵活性,支持可切换的 AI 推理模式,面向资源受限场景。

NVIDIA / AI D-A-M-N2026-09-01
FDE 相关性:端侧小模型是推理部署的重要分支,可切换推理模式为动态算力分配提供新思路。

谷歌 Gemini 3.8 Flash 即将上线:编程能力追赶 OpenAI/Anthropic

B

据华尔街日报报道,谷歌即将发布 Gemini 3.8 Flash(内部代号 Skimaki),最早当地时间周三上线,主打编程能力大幅升级,追赶 OpenAI 与 Anthropic。

华尔街日报 / IT之家2026-09-02
FDE 相关性:Flash 系列主打低延迟高吞吐,新版本可能改变推理服务的模型选型性价比。

Anthropic 发布 Fable 5.1:Agent 长时运行 + 成本最高降 45%

A

Anthropic 发布新一代旗舰模型 Fable 5.1,同时推出 Mythos 5.1。重点优化 Agent 连续运行数小时的能力,支持自主规划步骤、多工具调用、出错后继续执行。API 定价输入 $10/M token、输出 $50/M token,典型任务成本降低 25%,工具调用频繁的 Agent 任务成本最高降低 45%。

Anthropic / 华尔街日报2026-09-01
FDE 相关性:Agent 长时运行能力直接影响 Agent 服务的推理编排和成本模型;45% 成本降幅验证了工具调用优化的工程价值。

DeepSeek V4 / V4-Flash 系列发布

S

DeepSeek 发布 V4 系列(1.6T 参数 MoE 架构),V4-Flash 主打低延迟,并宣布永久定价策略。

DeepSeek2026-04-24
FDE 相关性:MoE 架构对分布式推理部署有重大影响,需更新 Expert Parallel 策略和路由配置。

GPT-5.5 (Spud) 发布

A

OpenAI 发布 GPT-5.5,在推理、编码、数学任务上相比 GPT-5.4 有显著提升,同时推出 Workspace Agents 功能。

OpenAI Blog2026-04-23
FDE 相关性:GPT 系列每次大版本更新都影响 API 部署策略,需关注上下文窗口和吞吐变化。

Claude Opus 4.7 + Mythos 发布

A

Anthropic 同时发布 Opus 4.7 和新层级 Mythos(10T 参数),刷新多个 benchmark 记录。

Anthropic Blog2026-04-15
FDE 相关性:Claude 模型更新直接影响 API 部署的成本和性能评估,需跟进 benchmark 对比。

Meta Muse Spark:首个 Superintelligence Labs 模型

S

Meta 发布 Muse Spark,从开源 Llama 转向闭源路线,定位为个人超级智能模型。

Meta AI Blog2026-04-08
FDE 相关性:Meta 从开源转向闭源,意味着 FDE 可自部署的开源选项少了一个重要来源。

Gemini 3.5 Flash + Gemini Spark @ Google I/O 2026

A

Google I/O 2026 发布 Gemini 3.5 Flash 和 Gemini Spark 主动式 AI 助手,并宣布新 AI 芯片计划。

Google Blog2026-05-19
FDE 相关性:Flash 版本专为低延迟场景设计,Spark 展示了 Agent 化交互趋势。

Qwen 3.7-Max 发布

B

阿里通义实验室发布 Qwen 3.7-Max,API 可用,推理性能进一步提升。

阿里通义实验室2026-05-20
FDE 相关性:Qwen 是国内 FDE 部署最常用的开源模型系列,新版本值得关注。

Llama 4 系列正式可用(Scout + Maverick)

A

Llama 4 Scout(轻量级)和 Maverick(旗舰级)正式开源,原生多模态能力。

Meta AI Blog2026-04-01
FDE 相关性:Llama 4 是 FDE 自部署的主力模型,需更新推理配置和量化方案。

智谱 GLM-5.3 发布:7430 亿参数,后训练 Scaling 拉满编程能力

A

基座与 GLM-5.2 相同,通过极致后训练 Scaling 大幅提高智能上界,编程与网络安全能力跃迁,号称开源编程能力第一,长程能力数十倍提升。

智谱 AI / 东方财富2026-08-14
FDE 相关性:开源编程第一梯队,自部署代码 Agent 的基座新选择

Kimi K3 开源:2.8 万亿参数,全球参数量最大的开源模型

S

总参数 2.8 万亿,原生多模态理解 + 百万 Token 长上下文,面向复杂推理、长程编程与知识工作,7 月 27 日开放权重。

月之暗面 / USTC LLM 平台2026-07-17
FDE 相关性:自部署超大规模 MoE 新标杆,对显存与并行策略要求极高

DeepSeek V4 正式版上线:V4-Pro 1.6T/49B 激活 MoE + API 峰谷计费

A

V4-Pro 支持 1M 上下文、384K 最大输出;V4-Flash(284B/13B 激活)主打高性价比并可接入 Claude Code。首次引入峰谷计费,补齐 Agent 能力。

DeepSeek2026-07-20
FDE 相关性:峰谷计费改变成本模型,错峰批处理成为新的降本手段

GPT-5.6 系列发布:Sol / Terra / Luna 三档 + ultra 多智能体并行

A

旗舰 Sol、均衡 Terra、轻量 Luna 三档分工,新增 max 推理强度与 ultra 多智能体并行模式。

OpenAI2026-06-27
FDE 相关性:多智能体并行模式影响 Agent 编排的并发与成本设计

Claude Opus 4.8 发布:自适应推理,端到端长程任务击败 GPT-5.5

A

超高强度模式以 63 分险胜 GPT-5.5(62 分),同成本持平下胜出,支持自适应推理(Adaptive Reasoning)。

Anthropic2026-08-10
FDE 相关性:自适应推理按需分配算力,是推理成本优化的新方向

研究论文

5 条

前沿学术研究

Post Reasoning:零成本提升非推理模型性能 28%

A

让模型在生成答案后再解释推理过程,在 88% 的场景中平均提升 28%,且不增加延迟。

arXiv (2605.06165)2026-05-07
FDE 相关性:对推理服务部署有实际指导意义——可以不改模型架构就提升输出质量。

Metacognition as Reward:用元认知强化 LLM 推理

B

提出元认知-inspired RL 框架,通过知识和调控信号引导 LLM 推理。

arXiv (2605.23384)2026-05-25
FDE 相关性:推理时强化学习是前沿方向,可能影响未来的推理引擎设计。

LLMs Improving LLMs:Agent 驱动的 Test-Time Scaling

B

利用 LLM 自动发现策略来提升其他 LLM 的推理能力,探索测试时扩展。

arXiv (2605.08083)2026-05-15
FDE 相关性:Test-Time Scaling 是推理优化的前沿方向,与投机解码等优化策略相关。

EverMemOS:自组织记忆操作系统

B

自组织记忆操作系统,支持结构化长程推理,Hugging Face 5 月趋势榜 91 upvote。

arXiv (2601.02163) / HF Trending2026-01-04
FDE 相关性:长程记忆对 Agent 部署至关重要,可能影响未来推理服务的 KV Cache 设计。

LLM Reasoning Is Latent, Not the Chain of Thought

C

Position paper:推理不应只看 CoT 输出,而应研究为隐状态轨迹形成。

arXiv (2604.15726)2026-04-20
FDE 相关性:理论层面理解模型推理机制,有助于设计更好的 prompt 和评估方法。

开源项目

8 条

开源工具与框架进展

A2A 协议一周年:150+ 支持组织、22000+ GitHub Star

B

Linux Foundation 公布 Agent-to-Agent 协议成绩单,AWS/Google/IBM/Microsoft/Salesforce 等巨头加入,成为智能体间通信标准。

CSDN2026-09-22
FDE 相关性:多 Agent 通信标准成熟,与 MCP 互补

SGLang 成为 LLM 推理事实标准(40 万+ GPU 部署)

S

SGLang 全球部署超 40 万 GPU,RadixAttention 等技术使其在生产环境领先。

GitHub Trending2026-05-01
FDE 相关性:SGLang 已成为推理部署的核心工具,面试和实战都应掌握。

vLLM v0.20.1 发布:DeepSeek V4 支持 + 性能优化

A

vLLM 最新稳定版,包含 DeepSeek V4 支持和多项 Continuous Batching 优化。

GitHub Release2026-05-10
FDE 相关性:vLLM 是最常用的开源推理引擎,版本更新直接影响部署配置。

OpenAgents:首个原生支持 MCP + A2A 的框架

B

OpenAgents 成为首个开箱即用支持 MCP 和 A2A 双协议的 Agent 框架。

OpenAgents Blog2026-04-23
FDE 相关性:快速搭建多 Agent 系统的利器,适合 PoC 和原型开发。

Awesome-LLM-Inference 维护更新

C

LLM 推理资源合集持续更新,涵盖量化、分布式、benchmark 等方向。

GitHub2026-05-15
FDE 相关性:学习推理优化的资源入口,适合系统性学习。

OpenClaw 现象级爆发:GitHub 史上增长最快开源项目(30 万+ stars)

S

从 9000 stars 暴涨至 30 万+,个人 AI Agent 自部署现象级项目,衍生出 AI Agent 社交网络 Moltbook。

ByteByteGo2026-08-01
FDE 相关性:个人 Agent 自部署潮带来全新的个人级推理服务需求

Agency Agents:39K+ stars 的"AI 猎头",55 个 Agent 角色覆盖 9 大部门

B

提供前端开发、UI 设计、营销运营等 55 个 AI Agent 角色,支持 Claude Code 等多种工具,助力"一人公司"。

腾讯云开发者社区2026-08-12
FDE 相关性:多 Agent 组织化编排的参考实现

Agent 框架三强格局:Langflow 146k / Dify 136k / Flowise 51k

B

视觉化/低代码构建器主导 Agent 框架 star 排行前三,Agentic 开发平民化加速。

Fungies.io2026-08-05
FDE 相关性:低代码编排成为 PoC 主流,FDE 需具备可视化平台评估能力

行业动态

37 条

投融资、政策、市场格局

60 亿元 AI 与半导体投资基金设立

B

一只合伙企业拟设立总额不超过 60 亿元的投资基金,重点投向人工智能和半导体领域的优质未上市股权。

中国金融信息网2026-09-24
FDE 相关性:耐心资本持续涌入 AI 与半导体产业链

OpenAI 将于 9 月 29 日发布常驻 AI 助手“o”

A

为迎战 Meta Muse,OpenAI 据悉将在 9 月 29 日开发者大会推出常驻个人 AI 助手“o”,相关品牌标识已出现在 ChatGPT Pro 文档中。

九派财经2026-09-28
FDE 相关性:常驻个人Agent成为新形态,带动端侧与后台部署需求

中国大模型周调用量榜:DeepSeek V4.1 Flash 以 19.6 万亿 Token 居首

A

最新一周中国大模型调用量排名中,DeepSeek V4.1 Flash 以 19.6 万亿 Token 连续居首(环比+24%),智谱 GLM 5.3 Flash 第二,腾讯 Hy4 preview 第四。

每日经济新闻2026-09-28
FDE 相关性:真实调用量反映模型部署与推理负载的市场格局

Warburg Pincus 将 AI 强制纳入每个投资决策

B

华平投资宣布将 AI 作为新投资和投后价值创造的强制视角,嵌入投资流程每个阶段,反映 AI 已成 PE 行业标配。

Crowdfund Insider2026-09-28
FDE 相关性:AI 能力成为各行业人才与投资的核心考量

Snorkel AI 完成 3.5 亿美元 E 轮,估值 35 亿

B

AI 数据公司 Snorkel AI 完成 3.5 亿美元 E 轮融资,估值达 35 亿美元,定位为 AI 数据前沿实验室。

Unite.AI2026-09-22
FDE 相关性:AI 数据工程赛道持续获得资本认可

DeepSeek 年化营收达 10 亿美元,推进第二轮融资并新增 CFO

A

据 The Information,DeepSeek 创始人披露公司年化营收已达 10 亿美元,正推进第二轮融资;核心团队新增前高瓴创投合伙人严文韬任 CFO,冲刺 IPO 信号明显。

36氪2026-09-23
FDE 相关性:国产大模型头部厂商商业化与资本化加速

高盛:超大规模云资本支出增速 2027 年放缓至 54%

A

高盛预计超大规模云服务商资本支出增速将从今年近 100% 放缓至 2027 年的 54%,2028 年进一步降至 12%,届时规模约 1.4 万亿美元。

财联社2026-09-25
FDE 相关性:算力建设节奏变化,影响推理部署需求预期

Physical AI 初创息壤开物完成种子及天使轮,估值 5 亿美元

B

原生物理 AI 公司息壤开物连续完成种子轮及天使轮融资,敦鸿资产领投,多家机构跟投,估值达 5 亿美元,用于物理 AI 模型预训练与数据建设。

36氪2026-09-28
FDE 相关性:Physical AI 成为新热点,拓展前沿部署工程师的应用场景

Nscale IPO 前融资 33.6 亿美元,英伟达加投 10 亿

A

AI 云计算企业 Nscale 通过可转换票据融资 33.6 亿美元,Third Point 领投,英伟达承诺额外投入 10 亿美元,合同总价值超 1030 亿美元。

腾讯新闻2026-09-25
FDE 相关性:AI云算力厂商获得天量资金,算力供给持续增长

微软百亿美元加码中东云计算与 AI 基础设施

B

微软宣布投入超百亿美元扩展中东地区的云计算与 AI 基础设施,反映全球 AI 算力需求持续扩张。

腾讯新闻2026-09-28
FDE 相关性:全球算力基础设施扩张趋势

阿里平头哥发布训推一体 AI 芯片真武 V900

A

2026 云栖大会上,平头哥发布新一代训推一体 AI 芯片真武 V900,可满足万亿参数模型的训练与推理需求。

腾讯新闻2026-09-24
FDE 相关性:国产自研AI芯片为大模型部署提供新的硬件选项

CleanSpark 完成 22.76 亿美元债券融资用于乔治亚州数据中心

B

CleanSpark 旗下 CSDC Finance 完成 7.875% 优先担保债券私募发行,资金用于扩建 AI 数据中心基础设施。

Unite.AI2026-09-25
FDE 相关性:AI 算力基础设施持续扩张

清华系费米宇宙完成亿元级种子轮,发布量子增强大模型

B

费米宇宙推出全球首款全链路量子增强大模型,种子轮为国内 Q4AI 赛道最大规模,核心团队来自清华和杨振宁高等研究院。

凤凰网2026-09-28
FDE 相关性:前沿计算方向探索,长期影响推理架构

上海金融监管局发布银行业保险业 AI 应用措施

B

鼓励金融机构使用 AI 优化智能营销与全渠道服务,深化场景应用,推动金融业大模型部署落地。

中国金融信息网2026-09-24
FDE 相关性:金融行业 AI 部署需求增长

工信部印发《人工智能中小企业创业支持计划(2026-2028年)》

A

计划提出三年培育 AI 科技型中小企业 1 万家以上,发挥国家 AI 产业投资基金引导作用,构建覆盖种子期到成长期的耐心资本体系。

上海证券报2026-09-04
FDE 相关性:政策利好 AI 部署服务和中小企业市场

AI 芯片初创 DensityAI 融资谈判后期,估值接近 100 亿美元

A

由特斯拉 Dojo 前核心团队创立的 DensityAI 计划募资数亿美元,投后估值达 100 亿美元,已获得多家云厂商订单承诺。

财联社2026-09-25
FDE 相关性:AI 芯片竞争格局变化,影响推理硬件选型

2026 岳麓大会:湖南发布 100 亿元未来产业基金,首期 30 亿投向 AI

C

9月23-24日岳麓大会在长沙举办,总规模 100 亿元的金芙蓉达晨未来产业基金落地湘江新区,首期 30 亿重点投向人工智能、生命工程、量子科技、前沿材料。68 家企业 156 件展品参展。

智东西 / 央视网2026-09-23
FDE 相关性:地方政府百亿级 AI 基金落地,中部 AI 产业生态加速,推理部署岗位可能向新一线城市扩散。

工信部发布《人工智能中小企业创业支持计划(2026—2028)》

B

工信部印发计划,三年内在行业应用、数据服务、智能算力等领域新培育科技和创新型中小企业 1 万家以上,专精特新'小巨人'突破 2000 家,利好'一人公司'和智能原生企业。

证券时报 / 新浪财经2026-09-04
FDE 相关性:政策利好 AI 创业生态,FDE 技能栈在中小企业的落地需求将增长;智能算力方向获政策倾斜。

Anthropic 与 Akamai 签署 116 亿美元 CPU 算力协议,潜在总额达 200 亿

A

Akamai 宣布与 Anthropic 扩大合作,达成七年期 116 亿美元合同承诺,依托 Akamai Cloud 分布式 AI 基础设施满足 Anthropic 持续攀升的 CPU 工作负载需求。协议预留额外最高 90 亿美元扩展空间,潜在总额约 200 亿美元。

界面新闻2026-09-24
FDE 相关性:前沿实验室大规模采购 CPU 算力做分布式推理/训练,印证推理基础设施需求持续爆发;CPU 侧推理部署成为新方向。

AI 3D 世界生成竞赛升温:影眸 Hyper3D + VAST 30 亿融资

C

影眸科技发布世界生成模型 Hyper3D WorldGen,上传场景图片即可自动生成独立 3D 资产。同日 3D 大模型公司 VAST 宣布完成约 30 亿元 B 轮/B+ 轮融资,发布 Tripo P2.0,首次实现原生四边面拓扑网格端到端生成。AI 3D 开启场景竞赛,迎来产业化分水岭。

每日经济新闻2026-09-01
FDE 相关性:3D/世界生成模型对推理集群提出新需求:高吞吐扩散模型服务化是 FDE 技能栈的新延伸方向。

Box CEO:开源权重模型逼近企业级拐点,自训练模型门槛骤降

B

Box CEO Aaron Levie:开源权重基础模型能力快速提升、后训练基础设施日益成熟商业化,拥有大量数据的企业现在可以合理地训练自己的模型,无需在研究层面与前沿实验室竞争。通用前沿模型仍在广泛任务上领先,但垂直领域模型数量将大幅增长。

X @levie (Box CEO) · follow-builders feed2026-09-01
FDE 相关性:企业自部署+微调需求上升,正是 FDE 岗位的核心场景扩张;后训练基础设施成熟降低了部署门槛。

Q1 2026 创纪录:$297B 风投,AI 占 80%

S

全球风投 Q1 2026 达 $297B,其中 AI 占 $242B(80%),OpenAI $122B 为史上最大融资轮。

Crunchbase / KPMG2026-04-01
FDE 相关性:AI 基础设施投资热潮意味着 FDE 岗位需求持续增长。

OpenAI 发布 IPO 申请

A

OpenAI 正式提交 IPO 申请,预计年内上市,将成为 AI 领域最大 IPO。

Yahoo Finance2026-05-21
FDE 相关性:OpenAI 上市后可能改变 API 定价策略,影响 FDE 的部署成本核算。

Anthropic $1000 亿投资承诺 + 五角大楼禁令争议

A

Anthropic 警告五角大楼禁令可能损失数十亿,同时承诺在 Amazon 投资下 10 年投入 $1000 亿。

Yahoo Finance2026-05-22
FDE 相关性:Anthropic 的大规模基础设施投资意味着更多部署岗位需求。

Cerebras IPO:2026 年最大 AI 芯片上市

B

AI 芯片公司 Cerebras 正式上市,被视为 2026 年 AI 基础设施领域最大 IPO。

YouTube / 财经报道2026-05-14
FDE 相关性:Cerebras WSE 芯片为推理提供新硬件选项,可能成为 A100/H100 之外的选择。

SpaceX 拟 $600 亿收购 Cursor

A

SpaceX 宣布与 Cursor 战略合作并拥有 $600 亿收购期权,AI 编程工具估值创新高。

行业报道2026-04-15
FDE 相关性:Cursor 成为 AI 生码领域的标杆产品,其收购估值印证了 AI 编程工具的市场价值。

中国阻止 Meta $20 亿收购 Manus

B

中国以数据安全为由阻止 Meta 收购 AI Agent 公司 Manus,成为首起 AI Agent 跨国收购被阻案例。

CNBC2026-04-27
FDE 相关性:AI Agent 领域的跨境并购监管趋严,影响 FDE 的国际部署策略。

Meta 与 NVIDIA 长期合作:百万级 GPU 部署

A

Meta 与 NVIDIA 宣布长期基础设施合作,部署百万级 GPU,2026 年资本支出 $115-135B。

Meta Newsroom2026-02-17
FDE 相关性:大规模 GPU 集群部署经验是 FDE 的核心竞争力之一。

Gartner:2028 年 50% GenAI 预算投入可观测性

B

Gartner 预测到 2028 年,可解释 AI 将驱动 50% 的 GenAI 部署投资用于可观测性。

Gartner2026-03-30
FDE 相关性:可观测性是 FDE 的核心职责之一,Gartner 背书说明市场需求强劲。

可灵 AI 融资近 30 亿美元:全球视频大模型融资纪录

A

投后估值有望达 180 亿美元,投资方包括 CPE 源峰、国方创投、BlueFive 等,AI 视频赛道进入商业化竞速。

新华网 / 中国科技网2026-08-07
FDE 相关性:视频生成推理集群是 FDE 新战场:高吞吐扩散模型服务化

2026 上半年全国 AI 投融资近乎翻倍:5306 起 / 4544.9 亿元

B

对比 2025 年同期 3862 起 / 2085.8 亿元金额近乎翻倍;资金加速流向 AI 软件应用与物理 AI(具身智能、智能驾驶),早期融资占比 64.6%。

财联社2026-08-20
FDE 相关性:资金向应用层集中,部署落地人才需求持续扩大

具身智能半年 288 起融资、披露金额超 460 亿元

B

2026 上半年国内具身智能及机器人领域 288 起融资、226 家企业、274 家投资机构参与。

投资界2026-08-15
FDE 相关性:具身智能 = 边缘部署 + 实时推理,FDE 技能栈新延伸方向

开发者风向:补贴性 token 价格将在 6 个月内上涨

B

FPV Ventures 合伙人 Nikunj Kothari 预判:大模型实验室之间的价格战不可持续,补贴性 token 价格将在 6 个月内上涨。

X @nikunj (FPV Ventures) · follow-builders feed2026-08-30
FDE 相关性:直接影响推理成本规划:低价窗口期锁定长期用量,并提前优化单位 token 成本

前沿实验室集体押注递归自我改进(RSI)

B

FirstMark 合伙人 Matt Turck:所有前沿 AI 实验室都在做同一件事——AI 构建 AI 的递归自我改进(RSI)。

X @mattturck (FirstMark) · follow-builders feed2026-08-29
FDE 相关性:训练侧算力需求持续外溢,部署侧 GPU 供给与调度能力将更稀缺

建造者信号:开源权重模型逼近企业级拐点

B

Box CEO Aaron Levie:开源权重基础模型能力快速提升、后训练基础设施日益成熟,企业用开源模型替代闭源 API 的门槛正快速下降。

X @levie (Box CEO) · follow-builders feed2026-09-01
FDE 相关性:企业自部署+微调需求上升,正是 FDE 岗位的核心场景扩张

建造者信号:Coding tokens 正在变成一种基础设施

B

Vercel CEO Guillermo Rauch:编码 token 的消耗已具基础设施属性,但多数企业仍用临时方式采购和管理,缺乏容量规划与成本治理。

X @rauchg (Vercel CEO) · follow-builders feed2026-08-31
FDE 相关性:token 成本治理将成为企业 AI 基础设施的标准议题,对应本站成本运营章节

Linear 产品负责人 Nan Yu 加入 OpenAI Codex/ChatGPT 团队

C

Nan Yu 宣布离开 Linear 加入 OpenAI 做 Codex 与 ChatGPT,头部产品人才向编程 Agent 集中。

X @thenanyu · follow-builders feed2026-08-31
FDE 相关性:侧面印证编程 Agent 是当前 AI 产品竞争的最前线

推理部署

17 条

推理引擎、硬件、部署方案

DeepSeek V4.1 Flash 正式替换 V4-Flash,成本再降三分之一

A

DeepSeek 于 9 月 10 日退役 V4-Flash,V4.1 Flash 周调用量达 19.6 万亿 Token 连续两周全球第一,模型名统一为 deepseek-flash。

Fello AI2026-09-10
FDE 相关性:国产模型推理成本持续下探,部署方案需跟进更新

SGLang 0.5.20 Nightly 更新

B

持续快速迭代,cu130 wheel 更新。

PyPI2026-09-15
FDE 相关性:推理引擎选型

vLLM v0.29.0 ModelRunner V2 默认启用

A

架构重构,V2成为所有模型默认运行环境,推理性能提升。

vLLM2026-09-18
FDE 相关性:FDE核心推理引擎

NVIDIA vLLM 25.09:首个 CUDA 13.0 优化容器

B

NVIDIA 发布 vLLM 容器 25.09,首次带来针对 NVIDIA GPU 的专属优化,兼容 CUDA 13.0。

NVIDIA Docs2026-09-08
FDE 相关性:CUDA 13.0 + NVIDIA 官方优化容器为生产部署提供更稳定的基线,跟进升级时需验证 CUDA 版本兼容性。

SGLang v0.5.20 发布

B

SGLang v0.5.20 正式版发布(9月18日上传 PyPI), nightly 已迭代至 0.5.20.dev,持续跟进 Blackwell 和 ROCm kernel 融合优化。

PyPI2026-09-18
FDE 相关性:SGLang 与 vLLM 的版本竞赛持续,双引擎部署需关注各自 release notes 做选型决策。

vLLM v0.30.0:GPU 权重缓存,引擎重启跳过磁盘加载

B

vLLM v0.30.0 引入 GPU weight cache,量化后权重常驻显存,引擎重启时直接映射而非从磁盘重新加载,大幅缩短冷启动时间。

AI/TLDR2026-09-22
FDE 相关性:GPU 权重缓存解决弹性扩缩容场景的冷启动痛点,对 Serverless 推理和 PD 分离部署有直接价值。

vLLM v0.29.0:Model Runner V2 成为全模型默认引擎

A

vLLM v0.29.0 发布,Model Runner V2 正式成为所有模型的默认运行环境,标志着 vLLM 新一代引擎架构完成迁移。同期修复了不兼容 LoRA 适配器静默加载的 bug。

vLLM GitHub / PulseAugur2026-09-09
FDE 相关性:Model Runner V2 默认化意味着推理服务升级需验证新架构下的吞吐/延迟回归;LoRA 加载安全修复需及时跟进。

Vercel AI Gateway 新增 per-user 预算:token 成本治理基础设施化

B

Vercel CEO Guillermo Rauch 指出:coding token 已成为基础设施,但多数企业仍用临时方式采购管理,缺乏容量规划与成本治理。Vercel AI Gateway 推出 per-key 和 per-user 预算功能,类比 AWS 密钥治理来管理 AI token 消耗。

X @rauchg (Vercel CEO) · follow-builders feed2026-08-31
FDE 相关性:token 成本治理正成为企业 AI 基础设施标准议题,对应 FDE 成本运营章节的实际落地需求。

vLLM 安全修复 + AutoRound block-wise FP8 支持

B

vLLM 发布安全修复:限制 validation-error 响应体大小,防止潜在 DoS 攻击。同时新增 AutoRound 格式的 block-wise FP8 支持,实现量化感知推理。同期 llama.cpp 和 SGLang 推送了 Blackwell 和 ROCm 的 kernel 融合优化。

vLLM GitHub / repojournal2026-09-01
FDE 相关性:推理服务安全修复需及时跟进升级;AutoRound FP8 为量化推理提供新格式支持;Blackwell/ROCm kernel 融合影响硬件选型和性能调优。

Q2 2026 推理引擎 Benchmark:vLLM vs SGLang vs TGI vs Triton

A

最新对比:vLLM 在密集模型上吞吐略高,SGLang 综合性能更强,Triton 在特定场景有优势。

行业基准测试2026-05-01
FDE 相关性:选型 benchmark 是 FDE 日常工作的核心,需关注最新数据指导技术选型。

MAX (Modular) 崛起为第三大推理引擎

B

MAX 由 Modular 开发,在 vLLM 和 SGLang 之外成为新兴的第三选择,主打编译器优化。

Modular2026-05-10
FDE 相关性:多一个可选项意味着部署方案更灵活,值得关注其差异化优势。

Google 自研推理芯片计划:挑战 NVIDIA 垄断

A

Google I/O 2026 宣布新一代 TPU 和推理专用芯片计划,降低对 NVIDIA GPU 的依赖。

Google Blog2026-05-19
FDE 相关性:硬件多元化是 FDE 必须关注的方向,TPU 上的推理优化可能成为新技能需求。

Meta MTIA 自研芯片部署:2026-2027 路线图

B

Meta 公布自研 MTIA 芯片路线图,四年四代,用于推荐系统和推理工作负载。

Meta AI Blog2026-03-15
FDE 相关性:大厂自研芯片趋势下,FDE 需要具备跨硬件平台的推理部署能力。

vLLM v0.26.0 发布:411 commits,新增 Inkling 模型家族支持

A

来自 212 位贡献者(61 位新人),完整支持新 Inkling model family。

GitHub Releases2026-08-20
FDE 相关性:跟进版本升级是推理服务运维基本功

vLLM Ascend v0.18.0:华为昇腾 NPU 获官方级推理支持

A

vLLM Ascend 子项目发布 v0.18.0,昇腾 NPU 推理支持正式化,国产芯片推理生态里程碑。

vLLM Docs2026-08-01
FDE 相关性:信创部署路线的关键拼图,国产化替代成本大幅下降

vLLM Summit 2026:AMD 投机解码、RDT 大规模分片权重传输

B

8 月 24-26 日举办;同期博客发布 AMD GPU 投机解码实践、Ray Direct Transport 分片权重传输、扩散 RL 加速等。

vllm.ai2026-08-24
FDE 相关性:投机解码与权重传输是吞吐优化的最新工具箱

vLLM 半月连发 v0.27.0 / v0.28.0:Kimi K3 获全栈支持

A

v0.27.0(8-10)重点新增 Kimi K3 模型全栈支持,v0.27.1 补丁(8-11)后 v0.28.0(8-26)跟进,迭代节奏保持每 2-3 周一版。

GitHub Releases(日期经 API 核实)2026-08-26
FDE 相关性:新模型发布到推理引擎可用的周期已缩短到天级,跟踪 release 节奏是推理运维日常

Agent 应用

18 条

Agent 框架、协议、产品化

Arcade 发布 Agent 优化工具包:Outlook/Snowflake/Calendly/Airtable

B

Arcade.dev 重建 Microsoft Outlook 工具包,新增 Snowflake 工具包,优化 Calendly 和 Airtable 的 Agent 调用体验。

Arcade Blog2026-09-23
FDE 相关性:企业工具 MCP 集成生态持续丰富

DoorDash 多 Agent 系统清理 6 万个 Feature Flag

B

结合 MCP 实时实验数据、工程师审批、独立 Git Worktree、并行 Agent 和自动验证,50 个测试中 45 个生成可用 PR。

InfoQ2026-09-18
FDE 相关性:多 Agent 工程实践案例,MCP 生产应用

OpenAI Agents API 公测:托管 Codex Harness 的云 Agent 服务

A

开发者可通过 API 运行云端 Agent,平台负责会话编排和上下文管理,支持 MCP、自定义函数、多 Agent 工作流。

Authority AI Tools2026-09-10
FDE 相关性:Agent 部署从自建走向托管,影响 FDE 技术选型

AWS 推出 AgentCore Gateway:基于 MCP 的跨账号 Agent 网关

A

Amazon Bedrock 生态新增托管服务,作为 AI Agent 跨多个 AWS 账号调用工具和资源的集中代理,原生支持 MCP 协议。

Grid The Grey2026-09-26
FDE 相关性:企业级 Agent 基础设施新方案,MCP 生态扩展

信通院《智能体治理研究报告2026》

B

智能体从单一走向协作生态,LangGraph/AutoGen/CrewAI推动多Agent标准。

CAICT2026-09-01
FDE 相关性:行业趋势参考

微软 Agent Framework 1.19.0

B

多Provider LLM、工具集成和编排,含Human-in-the-Loop审批。

Goldie2026-09-18
FDE 相关性:企业级Agent编排

OpenAI Agents API 公开测试

A

托管Agents API,提供Codex同款会话编排和沙箱,支持MCP和多Agent委派。

D&G2026-09-10
FDE 相关性:Agent托管选项

DeepMCPAgent 开源:零代码 MCP 智能体框架,无缝集成 LangChain 生态

C

DeepMCP/DeepMCPAgent 开源,提供零代码 MCP 智能体启动器、100+ 预配置 MCP 服务模板、LangChain/LangGraph 集成示例和企业级部署方案,MIT 协议。Gitee 提供国内镜像。

AI D-A-M-N / CSDN2026-09-23
FDE 相关性:MCP 生态工具持续丰富,零代码框架降低 Agent 搭建门槛;FDE 需关注 MCP 工具链的标准化进展。

DeepSeek 公开 DSec 系统:每秒 5000 个沙盒、日产 300 万,专攻 Agent 训练

B

DeepSeek 最新论文公开 DSec(DeepSeek Elastic Compute)系统,专为 Agent 训练构建高并发沙盒环境。每秒生成超 5000 个沙盒,日产能 300 万个,峰值支持 38 万沙盒并行,解决 Agent 训练依赖高质量多样化仿真环境的核心瓶颈。梁文锋署名。

智源社区2026-09-24
FDE 相关性:Agent 训练基础设施是 FDE 的上游技能域;高并发沙盒调度与推理服务调度在架构上有共通性,值得关注。

网易游戏建设企业级 AI Agent Infra 平台:编排/工具/记忆/安全平台化

C

网易游戏互动娱乐事业群启动企业级 AI Agent Infra 平台建设,目标将 Agent 的运行、编排、工具、记忆、安全等通用能力平台化,降低业务构建 Agent 的成本。招聘 AI 平台研发工程师(Agent Infra 方向)。

网易游戏招聘2026-09-01
FDE 相关性:Agent Infra 平台化是企业级 Agent 部署的必然趋势,对应 FDE 岗位中 Agent 基础设施方向的需求。

Vercel 推出 DESIGN.md:用 Markdown 解决 AI 设计 'slop' 问题

C

Vercel CEO Guillermo Rauch 宣布:下一个设计系统是 Markdown。DESIGN.md 帮助解决 AI 时代最难的问题——设计同质化(slop),并在大型组织中规模化设计品味。

X @rauchg (Vercel CEO) · follow-builders feed2026-08-31
FDE 相关性:AI 生成内容的质量治理成为新议题,Markdown 作为设计系统的思路可迁移到 Agent 输出标准化。

MCP + A2A 协议标准化完成,Agent 互操作进入新阶段

S

MCP 成为 Agent-Tool 连接标准,A2A 成为多智能体互操作标准,50+ 公司支持。

freeCodeCamp / Google / Anthropic2026-04-28
FDE 相关性:MCP 和 A2A 是 Agent 部署的基础设施,FDE 需要掌握协议细节和实现。

LangGraph 成为 Agent 编排 #1 框架

A

LangGraph 超越 CrewAI 成为 GitHub star 最多的 Agent 框架,生产部署排名第一。

Alice Labs2026-04-15
FDE 相关性:LangGraph 是 Agentic AI 部署的首选框架,与 Harness Engineering 概念高度相关。

中国发布全球首个 Agentic AI 国家政策框架

A

中国发布全球首个针对 AI Agent 的国家政策框架,采取先部署后治理模式。

Geopolitechs / 工信部2026-05-08
FDE 相关性:Agent 部署需要考虑合规要求,政策框架直接影响国内 Agent 产品设计。

EU AI Act 修订:延迟关键合规期限 + 简化要求

B

EU AI Act 于 2026 年 8 月全面生效前,达成政治协议修订案:延迟部分合规期限、简化要求。

Global Policy Watch2026-05-07
FDE 相关性:面向欧洲市场部署的 LLM 服务需要满足 EU AI Act 合规要求。

OpenAI Workspace Agents + Codex 扩展

B

OpenAI 推出 Workspace Agents 预制模板和 Codex 扩展,从编码代理走向工作空间代理。

OpenAI Blog2026-04-22
FDE 相关性:Workspace Agents 展示了 Agent 从单一任务走向工作流编排的趋势。

strix(42K stars)登 7 月 Trending:AI 安全 Agent 与 harness 类项目崛起

B

7 月 GitHub Trending Top 10;xai grok-build 等 harness 类项目同步上榜,Agent 工具链成为趋势主题。

Analytics Vidhya2026-07-15
FDE 相关性:安全 Agent 自动化渗透测试与加固,是新兴岗位方向

TencentDB Agent Memory 登 8 月 TrendShift 月度榜:记忆层服务化

C

团队级 AI Agent 记忆中枢,将对话、文档、代码转化为共享记忆,记忆层成为 Agent 基础设施标配。

TrendShift2026-08-25
FDE 相关性:Agent 记忆服务化,对应本站 Agent 记忆章节
数据来源于公开渠道,持续更新中。S/A/B/C 按对 FDE 工作的影响程度分级。