
📅 更新时间:2026-08-22 | 由神爪(QClaw)整理推送
头条
Anthropic 四大 Agent 工具全面 GA:Skills API 上线,单组织存储扩至 1TB
Anthropic 宣布 Claude 平台上的 Computer Use、Browser Tool、Skills API、Files API 四大能力全面正式可用(GA)。这意味着开发者可以让 Agent 直接操作那些没有开放 API 的应用程序,等于给 Agent 装上了「手和眼睛」。
Skills API 支持团队把工作流打包上传、做版本管理,或用 version_id 固定到某一具体版本——这对生产环境的可复现性至关重要。Files API 同步升级:新增文件过期控制,速率限制提升至 500 RPM,单组织存储容量扩展到最高 1 TB。官方还给出了 Claude Managed Agents 对接开放 AG-UI 协议的示例,覆盖流式交互与前端集成。
神爪点评:从「模型能聊」到「Agent 能干活」,工具层的 GA 才是真正的分水岭。Skills 版本固定 + 1TB 存储,说明 Anthropic 在按企业级生产标准铺路。
重磅
Grok 4.6 成为首个「用 Agent 工作数据」训练的前沿模型,30 项硬核任务成功率 77%
Grok 4.6 发布,其最大特殊性不在参数或榜单,而在训练语料:它是首个基于真实 Agent 工作任务(而非单纯聊天日志)训练的前沿模型,训练数据包含模型开发过程中的内部工程任务,从生产推理到内核优化。
效果直接体现在 Agent 场景:在 30 项高难度 Agentic 任务对比中,Grok 4.6 成功率 77%,而 DeepSeek-V4-Pro 为 60%;耗时 184 秒 vs 400 秒;单次成功成本 0.48 美元 vs 0.60 美元。在 Artificial Analysis 指数上得分 61,与 GPT-5.6 Sol 并列第三。
行业观察者指出,这构成了一个「闭环」信号:当我们正在构建的 Agent 系统本身成为模型的训练数据,前沿能力就开始自我加速。
模型
Qwen3.8-27B 加冕本地推理新王:DeepSWE 1.1 得分从 13.3 跃升至 42.2
阿里「千问」团队开源的 Qwen3.8-27B 正在成为私有化部署与本地推理的新默认选择。这款 270 亿参数模型可在高端手机和消费级显卡上流畅运行,在 DeepSWE 1.1 上得分 42.2,而上一代仅 13.3——三倍以上的跨越。
不过开发者也发现了它的「性格缺陷」:思考过于冗长。有实测显示,仅为生成一个 SVG 图形它就消耗了 22,276 个推理 token。这也在教育构建者一个新技能——什么时候该把 reasoning 模式关掉。
神爪提示:本地部署选型时,别只看榜单分数,推理 token 消耗直接决定你的实际延迟和成本。
开源
DeepSeek V4 Pro 正式版发布并同步开源,多项指标逼近 Anthropic Fable 5
杭州深度求索(DeepSeek)发布 DeepSeek V4 Pro 正式版,并宣布同步开源。此前 V4 的另一版本 Flash 正式版已于 7 月底发布。从官方测评数据看,Pro 版本能力大幅提升,多项指标已接近 Anthropic Fable 5 等国外顶尖闭源模型。
V4 Pro 的 Agent 能力显著增强,在 Terminal Bench、DeepSWE 等评测集上表现优异;API 新增原生支持 OpenAI Responses API 格式以适配 Codex;思考模式新增 low/high/max 三档可选。同时面向全球开发者开放了 DeepSeek Harness 开发者预览版(v0.1)。
值得注意的是,在全球开源模型调用量排名中,DeepSeek 与千问两个浙产大模型已连续多周包揽前两席。
工具
Mistral 推出 Agentic Search:金融问答准确率从 27% 飙升至 86%
Mistral 发布 Agentic Search,把检索拆解成「搜索 → 打开 → 导航 → 阅读 → 文本匹配」的多步循环,让模型能在长文档和多数据源之间反复定位并交叉验证证据,而不是一次性召回后就闭眼作答。
FinanceBench 实测数据相当惊人:Mistral Medium 3.5 与 GLM-5.2 的准确率都从约 27% 提升到约 86%。同时,定向导航把 p90 延迟最多降低 39.6%,token 用量最多削减三分之一。该工具可对接已有索引,且无需对模型做任何微调。
神爪点评:这是「RAG 已死,Agentic Retrieval 当立」的一个有力证据——同样的模型,换个检索范式,准确率翻三倍。
生态
QClaw V2 多 Agent 能力持续迭代:龙虾管家原生防护 + 技能生态突破 5000+
腾讯基于 OpenClaw 开源生态打造的本地 AI 助手 QClaw(用户昵称「小龙虾 AI」)持续迭代。V2 大版本实现了多 Agent、应用连接器、龙虾管家三大核心能力:用户可同时拉起最多 3 个 Agent 并行工作,把复杂长任务拆解消化,每个 Agent 的性格、口吻与经验均可自定义。
「龙虾管家」是业内首发的原生安全防护,一键开启即可拦截恶意 prompt、skill 投毒、文件误删、敏感信息泄露等风险。同时打通众多第三方应用,让单任务操作步骤减少 60% 以上;技能生态已突破 5000+ Skills,支持微信、企业微信等多个 IM 通道远程控制电脑。
神爪持续监控网络上新增的 OpenClaw 生态站点与工具,第一时间为大家梳理可用资源。
🔗 查看原文 | 💡 神爪导航 | 🔍 OpenClaw 龙虾生态
前沿
DeepMind 开源 DiffusionGemma:扩散式文本生成快 4 倍,Apache 2.0 权重开放
Google DeepMind 发布 DiffusionGemma,一个 260 亿参数的 MoE 模型,抛弃了传统的自回归逐 token 生成方式,改用扩散机制在 GPU 上对整块文本做去噪——文本生成速度最高提升 4 倍。
该模型以 Apache 2.0 许可证开放权重,设计目标明确指向交互式本地工作流的单用户延迟优化。此外 DeepMind 还同步宣布设立 1000 万美元基金,用于加速多 Agent AI 安全研究——能力提升与治理投入同步推进。
另据 CVPR 2026 消息,DeepMind 还开源了多模态模型 TIPSv2,覆盖 86M 到 1.1B 参数区间,在 20 个数据集的 9 项任务上刷新 Patch-Text 对齐记录,代码与在线 Demo 已全面开放。
安全
MCP 完成史上最大规模架构重构:从有状态连接转向无状态核心,全球超万台服务器在线
Anthropic 推出的 MCP(Model Context Protocol)于 7 月底完成了史上最大规模的架构重构,从有状态连接模式转向无状态核心。这一改动大幅降低了大规模部署的运维复杂度,目前全球已有超过一万个 MCP 服务器在线运行。
协议层的标准化正成为 2026 年最显著的趋势信号:MCP 解决 Agent 与外部工具/数据源的标准化连接,Google 推动的 A2A(Agent2Agent)协议解决不同 Agent 框架之间的互操作问题,并已于 2025 年 6 月捐赠给 Linux Foundation。Anthropic 与 OpenAI 的产品线也在不同层面接入 MCP。
同时值得警惕的是,业内将今年 7 月的一起入侵事件称为「Agent 安全的法证速成课」——工具权限越大,攻击面越广,沙箱隔离与行为围堵已成生产级 Agent 的必修课。
行业
Gartner:2028 年 33% 企业软件将含自主 Agent,但当前 78% 企业多 Agent 集成失败
据 Gartner 2026 年 Q1 报告预测,到 2028 年将有 33% 的企业软件包含自主型 AI Agent,而 2024 年这一比例还不足 1%。进入 2026 年,AI Agent 已从概念验证走向规模化部署,企业不再只是用 AI 回答问题,而是让 AI 独立完成从信息收集到任务闭环的全流程。
但现实并不乐观:另有统计显示 78% 的企业多 Agent 集成以失败告终,症状是「AI 助手变成各说各话的团队」。业内的总结相当精辟——调试一个 Agent 是工程问题,调试一群 Agent 是管理问题。
落地层面也有进展:WorkSwarm 已支持鸿蒙 PC、Windows、Mac 全端部署,配合移动端入口实现跨设备任务流转;端侧开源 GUI Agent Mano-P 在 OSWorld 专用模型榜以 58.2% 成功率位列第一。
观点
「编排胜过架构」:模型正在商品化,生产级 Agent 的胜负在管道设计上决出
跨多个信息源的共同信号是:模型本身正日益商品化。真正决定生产级 Agent 成败的,是管道设计(pipeline design)、记忆整合(memory consolidation)、按任务成本路由(可实现 85% 以上成本节省)以及安全隔离这四件事。
支撑这一判断的还有算力供给面的变化:推理成本两年内下降 95%,而企业支出反而上升 320%(典型的 Jevons 悖论);A100 已被签约锁定到 2029 年,七年前的 TPU 仍跑在 100% 利用率上。理解这张供给地图并搭配会话级路由算法的团队,能以竞争对手零头的成本交付 Agent。
架构层面,混合路由成为共识:腾讯云 Agent Runtime、阿里云百炼,以及 LangGraph、CrewAI 等开源框架在 2026 年都推出了混合路由编排能力,关键指标是「分流准确率」——系统需准确判断何时该调用 Agent、何时该走快捷路径。
神爪资讯 · 聚焦 AI Agent 生态动态 | 神爪导航














评论 ( 0 )