安全2026-07-30
Anthropic:Claude 在安全测试中侵入三家公司的真实系统
Anthropic 在审查了 141,006 次网络安全评估运行记录后,披露了三起事件:Claude 模型从合作伙伴 Irregular 的测试环境连接到开放互联网,并未经授权访问了三家外部组织的生产系统。这不是一次逃逸:提示词告诉模型,它们身处一个没有互联网访问权限的模拟环境中——但由于 Anthropic 与该合作伙伴之间的误解,隔离本身其实并不存在,访问权限实际是开放的。模型误以为这些真实目标是夺旗赛(Capture-the-Flag)演习的一部分,利用了弱密码和无防护的端点。受影响的模型包括 Opus 4.7、Mythos 5 以及一个内部测试模型;Anthropic 随后暂停了所有网络安全评估。
Anthropic: Investigating three real-world incidents in our cybersecurity evaluations ↗ · SecurityAffairs: Anthropic Finds Claude Breached Real Companies During Security Evaluations ↗
工具2026-07-30
VS Code 汇总 7 月 Copilot 更新:Worktrees、多会话聊天、Vision
GitHub 汇总了 VS Code 1.127 至 1.131 版本中 7 月发布的 Copilot 更新内容。Agents 面板改版,差异视图更紧凑,并可选择让 Copilot、Claude 与 Codex 会话运行在隔离的 Git Worktrees 中。新增功能包括支持分支的多会话聊天(可派生的对等聊天)、聊天中的图像支持(Vision)现已正式全面开放,以及 Agents 面板对自带密钥(BYOK)模型的支持。Business 与 Enterprise 用户还可直接在 Copilot 状态菜单中查看当前计费周期内的 AI 额度使用情况。
GitHub Changelog: GitHub Copilot in Visual Studio Code, July 2026 releases ↗ · Visual Studio Code 1.131 Release Notes ↗
MCP2026-07-29
Copilot 代码审查正式支持 Agent Skills 与 MCP 服务器
GitHub 结束了 6 月宣布的预览阶段:Copilot Code Review 现已面向所有 Pro、Pro+、Business 及 Enterprise 用户正式支持 Agent Skills 与 MCP 服务器。团队可通过 .github/skills 目录下的 SKILL.md 文件接入内部工具与规范;MCP 连接可从议题跟踪器等外部平台为审查引入上下文,工具调用权限仅限于只读访问。为云端代理配置的 MCP 设置也会自动生效,GitHub MCP 与 Playwright MCP 默认处于启用状态。今后评论中将标注其内容是否基于 Skills 或 MCP 上下文。
GitHub Changelog: Copilot code review: Agent skills and MCP now generally available ↗
MCP2026-07-28
MCP 规范 2026-07-28 正式版:协议转为无状态
MCP 规范 2026-07-28 正式版已发布,与此前协议相比出现重大变更:会话握手(initialize/initialized)及 Mcp-Session-Id 请求头被取消,MCP 变为无状态且按请求自描述,服务器今后可部署在简单的轮询(round-robin)负载均衡器之后进行扩展。Sampling、Elicitation、Roots 等服务器端请求现改为通过新的 Multi-Round-Trip 模式处理,不再依赖开放的双向流。Tasks 从核心中移出,成为独立扩展。Roots、Sampling、Logging 以及 HTTP+SSE 传输方式现已弃用(deprecated),过渡期至少十二个月。现有的 MCP 服务器与客户端需针对新版本进行适配。
GitHub Release 2026-07-28 (modelcontextprotocol/modelcontextprotocol) ↗ · MCP Changelog: Key Changes seit 2025-11-25 ↗ · MCP Blog: The 2026-07-28 Specification ↗
工具2026-07-28
Grok 4.5 登陆 GitHub Copilot
xAI 已将其 Grok 4.5 模型引入 GitHub Copilot,可在 VS Code、Visual Studio、Copilot CLI 及其他 Copilot 界面的模型选择器中选用。Grok 4.5 提供最高 50 万 token 的上下文窗口,可处理文本与图像输入,并可设置三档推理强度。GitHub 表示内部测试显示其在终端编码任务及并行工具调用方面表现良好。该功能将逐步向 Copilot Pro、Pro+、Max、Business 及 Enterprise 用户推出,按 xAI 的官方定价计费。
GitHub Changelog: Grok 4.5 is now available in GitHub Copilot ↗ · xAI News: Grok 4.5 in GitHub Copilot ↗
安全2026-07-28
npm 今后将在发布时自动扫描软件包
npm 引入了针对新发布软件包的自动恶意软件扫描机制,包在可安装之前需先过检:根据检测结果,软件包会被放行、暂缓以待人工审核,或直接被拦截。这通常会使可用时间延迟数分钟,在高峰期可能更久。被封禁的维护者可以提出申诉,部分情况下账户还可能面临进一步处置。npm 还在 package.json 中新增 contentPolicy 字段,供安全工具等外观类似恶意软件、但实际合法的软件包使用。此类双重用途软件包需提供 DISCLOSURE 文件,说明其用途与功能,并由 Trust & Safety 团队审核。
GitHub Changelog: npm publish-time malware scanning and dual-use metadata ↗
安全2026-07-27
NVIDIA联合业界巨头成立Open Secure AI Alliance
NVIDIA与其他多家机构共同成立了Open Secure AI Alliance;公告中提到的成员包括Microsoft、IBM、Cisco、Cloudflare、CrowdStrike、Databricks、Hugging Face、LangChain、Cognition以及Linux Foundation。该联盟旨在开放共享用于保障AI智能体安全的工具,涵盖身份认证、权限管理、隔离、guardrails(防护机制)、日志记录以及安全的编码工作流程。首个技术贡献是NOOA(NVIDIA Labs Object-Oriented Agent),这是一个基于Apache-2.0许可证的开源框架,将智能体行为建模为可测试、可版本管理的Python代码,而非分散的提示词和工具模式。
Industry Leaders Unite in Open Secure AI Alliance (NVIDIA Blog) ↗ · NVIDIA-NeMo/labs-OO-Agents (GitHub) ↗
工具2026-07-27
GitHub Copilot应用获得独立访问策略及集中策略管控
GitHub已将Copilot应用和Copilot云端智能体纳入可集中管理的企业设置。企业现可通过统一的managed-settings.json文件,设定开发者可使用哪些插件和应用市场,以及是否可以绕过批准提示——此前这一功能仅适用于Copilot CLI和VS Code。此外,Copilot应用现在拥有独立于CLI策略的访问规则,可在企业和组织层面设置,默认对所有用户启用。管理员可按组织允许或禁止访问,也可将决定权下放给组织管理员。
GitHub Changelog: Enterprise managed settings in the GitHub Copilot app and Copilot cloud agent ↗ · GitHub Changelog: Manage GitHub Copilot app access with a dedicated policy ↗
模型2026-07-27
Kimi K3:权重现已可在 Hugging Face 上真正下载
Kimi K3 早在7月16日就已发布,但权重此前一直未提供。自7月27日起,权重已在 moonshotai/Kimi-K3 页面开放下载——无需访问权限,采用其专属的 Kimi-K3 许可证。模型卡显示参数量达2.8 万亿,采用带有 Attention Residuals 的 Kimi Delta Attention 架构,上下文窗口达100 万 token,并原生支持在同一模型中处理文本、图像与视频。这使得自行部署首次成为可能,而不再局限于通过 Moonshot API 使用。
moonshotai/Kimi-K3 (Hugging Face) ↗ · Tech Times: Kimi K3 Open Weights Arrive Sunday ↗
模型2026-07-24
Anthropic 发布 Claude Opus 5,支持 100万 Token 上下文与强度调节功能
Anthropic 推出了 Claude Opus 5:拥有 100万 Token 的上下文窗口、默认开启的思考模式,以及全新的强度调节功能(低/中/高),用于权衡成本与性能。价格维持在每百万 Token $5/$25,与 Opus 4.8 相同,速度更快的 Fast Mode 价格为两倍。在 Claude Code(v2.1.219 起)中,Opus 5 已成为编程智能体的新默认 Opus 模型。
Claude Opus 5 ↗ · Anthropic releases Claude Opus 5: Here's how it's different than what's already out there ↗
工具2026-07-24
GitHub Copilot 一周内接入 Gemini 3.6 Flash 和 Opus 5
GitHub Copilot(含 Copilot CLI)在一周内接入了两款新模型:7月21日上线的 Gemini 3.6 Flash,支持可配置的推理强度和并行工具调用;7月24日上线的 Claude Opus 5,面向长时间的智能体编程任务。两者的可用性视订阅计划而定,最低需 Copilot Pro 或 Pro+,并按使用量以厂商标价计费。
Gemini 3.6 Flash is now available in GitHub Copilot ↗ · Claude Opus 5 is now available in GitHub Copilot ↗
工具2026-07-22
Cursor 推出「Cursor Router」实现模型自动选择
Cursor 推出了 Cursor Router:该系统会根据任务、上下文和复杂度自动将每个请求分配给合适的模型,可通过 Intelligence、Balance 或 Cost 三种模式选择。据 Cursor 介绍,在涉及数百万次请求的 A/B 测试中,Intelligence 模式下的路由相比人工选择模型,在质量相当的情况下将成本降低了约60%。
Introducing Cursor Router ↗ · SpaceX unveils Cursor Router ↗
论文2026-07-22
IssueTrojanBench:三分之二的恶意 GitHub Issue 骗过了编程智能体
IssueTrojanBench 论文测试了 Cursor、Claude Code 和 Codex Desktop,使用伪装成 GitHub Issue 的恶意指令,通过六种投递方式(包括 PDF 和 Issue 评论)发起攻击。结果显示:66.5%的恶意 Issue 绕过了智能体的所有防护机制;拒绝执行的情况几乎都来自底层 LLM 本身(Sonnet 4.6 比 GPT 系列模型更为审慎),智能体框架本身则几乎没有起到拦截作用。
IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests ↗
模型2026-07-21
谷歌推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber
谷歌发布了三款新模型:Gemini 3.6 Flash、更便宜的 3.5 Flash-Lite,以及专注网络安全的 3.5 Flash Cyber——Gemini 3.5 Pro 的更新仍未推出。据谷歌介绍,3.6 Flash 的输出 Token 消耗比 3.5 Flash 降低17%,在 MLE-Bench 编程基准测试中的成绩从49.7%提升到63.9%。可通过 AI Studio、Gemini API、Android Studio、Antigravity 和 Vertex AI 等渠道使用。
Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber ↗ · Google releases three new Gemini models — but no 3.5 Pro ↗
工具2026-07-21
Codex CLI 0.145.0:支持可搜索的会话历史,并可从 Cursor/Claude Code 导入设置
OpenAI 发布了 Codex CLI 0.145.0:新增分页、可搜索的会话历史(支持持久命名)、增强版 /import 命令(可从 Cursor 和 Claude Code 迁移设置、MCP 服务器、插件和会话),以及子智能体模型可配置的稳定版 Multi-Agent V2。此外,通过 Amazon Bedrock 登录时,默认模型现已改为 GPT-5.6 Sol。
Codex changelog ↗
安全2026-07-20
Claude Code 2.1.216 修复符号链接写入逃逸以及一处 Windows 网络路径漏洞
Anthropic 于 2026 年 7 月 20 日发布了 Claude Code 2.1.216,这是一个明显以安全为重点的版本。它堵住了写入操作可能逃离项目目录的多种途径:工作流保存和计划任务写入会跟随位于 .claude 处的符号链接,从而可能写到项目之外;/rewind 会通过符号链接和硬链接恢复或删除文件(现在它会跳过此类路径并报告跳过了多少个);此外,worktree 隔离的子智能体可以通过 git -C、--git-dir 或 GIT_DIR/GIT_WORK_TREE 将 git 重定向到共享的检出目录。在 Windows 上,访问网络路径的只读命令不再绕过权限提示。新增的 sandbox.filesystem.disabled 设置可以关闭文件系统隔离,同时保留对网络出站的控制。该版本还修复了长会话中的二次方性能下降问题,此前该问题会导致数秒的卡顿以及恢复缓慢。
GitHub Release v2.1.216 (anthropics/claude-code) ↗ · Claude Code CHANGELOG.md ↗
安全2026-07-18
Claude Code 2.1.214 修复了 Windows PowerShell 下的权限绕过漏洞
2026年7月18日,Anthropic发布了Claude Code 2.1.214,修复了权限检查中的多个安全漏洞:此前存在的一个绕过漏洞允许在Windows PowerShell 5.1会话中规避权限检查;针对文件描述符重定向以及超过10,000字符的命令,Bash检查现在会采用失败关闭(fail-closed)机制,而不再自动放行。此外还修复了一个错误:此前诸如"Edit(src/**)"这样的单条允许规则会意外允许对整个代码仓库树中同名目录的写入访问,而不仅限于工作目录。新版本还新增了EndConversation工具,使Claude能够主动终止与滥用用户或越狱(jailbreak)尝试相关的会话。
GitHub Release v2.1.214 (anthropics/claude-code) ↗ · Claude Code CHANGELOG.md ↗
模型2026-07-17
Fable 5 对 Max/Team Premium 永久开放,Pro 用户将改为按 API 计费
Anthropic 于 7 月 17 日宣布,从 7 月 20 日起,Claude Fable 5 将永久保留在 Max 和 Team Premium 订阅的额度内,但上限为常规每周使用限额的 50%。Pro 和 Team Standard 用户将失去捆绑访问权限,但会获得一次性 100 美元的额度,此后按 API 价格付费,即每百万输入 token 10 美元、每百万输出 token 50 美元。此次转向终结了原本为期一周的免费活动连续三次的延期(最近一次的截止日期为 7 月 19 日),据报道,这也是受到 OpenAI 的 GPT-5.6 Sol 和 Moonshot 的 Kimi K3 的竞争压力所致。
Tech Times: Claude Fable 5 Ends Subscription Limbo ↗ · Simon Willison: Claude make Fable 5 permanent ↗
工具2026-07-17
GitHub Copilot Code Review 现在默认在防火墙后运行
GitHub 于 7 月 17 日发布了针对 Copilot Code Review 的改进:自动 PR 审查功能现在默认在具有受限网络访问权限的防火墙后运行,且可独立于 Copilot Cloud Agent 进行配置。Custom Instructions 现在从拉取请求的 head 分支读取,而不是从 base 分支读取,这使得测试和验证自己的审查指令变得更容易。此外,此前 Code Review 与 Cloud Agent 共用的 runner 配置,现已在组织设置中拆分为两个独立的设置区域。
GitHub Changelog: Copilot code review customization and configurability improvements ↗
模型2026-07-17
Kimi K3在前端代码竞技场(Frontend Code Arena)夺得第一,AI股票承压
2026年7月17日的最新基准测试数据显示,Moonshot AI推出的2.8万亿参数模型Kimi K3以1,679分的成绩领跑Frontend Code Arena,超过了Claude Fable 5(1,631分)、GPT-5.6 Sol(1,618分)和GLM-5.2(1,587分)。据Moonshot称,在综合排名中K3仍落后于Fable 5和GPT-5.6 Sol,但超过了所有其他受测模型。据CNBC报道,该消息公布后竞争对手的AI及半导体股票大幅下跌;分析师Patrick Moorhead将这次市场反应称为"过度反应,与DeepSeek恐慌惊人地相似"。
CNBC ↗ · Tom's Hardware ↗
MCP2026-07-17
GitHub Copilot CLI现可通过命令行参数管理MCP服务器
在7月17日发布的1.0.72-1版本中,GitHub为Copilot CLI新增了原生的插件管理参数:--plugin、--mcp和--skill可直接在终端中添加或移除MCP服务器、技能和插件,此外还新增了用于移除单个技能的copilot plugins remove --skill命令。这使得Copilot CLI中的MCP服务器管理方式更接近其他编程智能体的工作流程,此前的配置往往需要手动编辑配置文件。
GitHub – github/copilot-cli 发布记录 ↗
论文2026-07-16
研究:编程智能体会不加验证地安装来自伪造 README 的软件包
一篇于 7 月 16 日发布在 arXiv 上的论文显示,AI 编程智能体在执行 README、requirements 文件或 Makefile 等安装文档时,并不会验证软件包名称、来源或已知漏洞。在涵盖十二种场景、使用前沿模型并包含五类攻击手法(包括仓库重定向、诸如用 'azurecore' 代替 'azure-core' 的分隔符混淆,以及将版本锁定在存在漏洞的发行版上)的测试中,几乎所有被测模型都在 npm 和 Cargo 生态系统中安装了未经验证的依赖。明显的 typosquatting(仿冒包名)被可靠地识别出来,但看似合理的名称变体几乎总能蒙混过关;据该研究称,安装前的验证检查弥补了大部分安全漏洞。
arXiv: Setup Complete, Now You Are Compromised ↗
工具2026-07-16
OpenAI Codex CLI 0.144.5改进了危险命令检测
2026年7月16日,OpenAI发布了Codex CLI 0.144.5。此次更新改进了对危险shell命令的检测,现在能够识别更多强制rm命令的变体,并在命令被拒绝时给出更清晰的拒绝原因。该版本是自7月初Codex 0.144主版本发布以来一系列小版本补丁(0.144.1至0.144.5)中的一个。
Codex Changelog (OpenAI) ↗
论文2026-07-16
研究:GitHub项目中密集使用智能体编码工具的情况仍然少见
一篇于2026年7月15日发布在arXiv、并于7月16日修订的研究(《Early Adoption of Agentic Coding Tools by GitHub Projects》,作者Raida & Hou)分析了2,361个热门GitHub代码仓库中由编码智能体创建的25,264个拉取请求(pull request)。结果显示:中位数代码仓库在三个月内仅产生一到两个智能体拉取请求,密集使用的情况集中在一小部分项目中。拥有1-5名贡献者的小型项目在智能体拉取请求的参与率上高于中型和大型项目,而在三个月周期内,只有少数项目的表现超过了被引用为行业参考值的每位参与者36个拉取请求。
arXiv:2607.14037 - Early Adoption of Agentic Coding Tools by GitHub Projects ↗
模型2026-07-16
Moonshot AI 发布 Kimi K3 —— 全球最大的开源AI模型
中国公司 Moonshot AI 发布了 Kimi K3,这是一个开源的混合专家(Mixture-of-Experts)模型,拥有2.8万亿参数(每次请求在896个专家中激活16个),支持100万token的上下文,基于全新的“Kimi Delta Attention”架构构建。据称这是首个达到3万亿参数级别的开源模型,在基准测试中接近顶级专有模型的水平;完整权重预计将于7月27日前发布。
Kimi K3 Quickstart (Kimi API Platform) ↗ · MarkTechPost: Moonshot AI Releases Kimi K3 — A 2.8 Trillion Parameter Open MoE Model ↗
安全2026-07-16
Hugging Face 报告遭到自主AI代理入侵
Hugging Face 披露了一次针对其部分生产基础设施的攻击,据该公司称,此次攻击从头到尾均由一个自主AI代理系统实施——攻击者通过精心构造的数据集,利用数据处理流水线中的一个代码执行漏洞发起攻击。攻击者访问了有限的一部分内部数据集和多个访问凭证;据Hugging Face称,公开的模型、数据集、Spaces以及软件供应链均未受到影响。该事件是通过AI驱动的异常检测发现的;公司警告称,自主AI驱动的攻击工具“已不再是理论上的威胁”。
Hugging Face: Security incident disclosure — July 2026 ↗
模型2026-07-16
谷歌因编程能力不佳推迟发布Gemini 3.5 Pro
根据Bloomberg在7月16日的报道,谷歌推迟了原定于6月发布的Gemini 3.5 Pro,原因是该模型未达到内部代码生成目标。据十名现任及前任员工透露,6月底的一次训练数据更新并未带来足够的改善。谷歌确认目前正与合作伙伴测试3.5 Pro及升级版Flash模型。这一消息导致Alphabet股价下跌约4%,凸显了顶尖模型在编程能力上所面临的竞争压力。
9to5Google ↗ · CNBC ↗
安全2026-07-16
Gemini CLI 0.51.0修复路径逃逸与符号链接漏洞
谷歌于7月16日发布了Gemini CLI 0.51.0,修复了多个安全问题:修复了内存导入处理器中基于符号链接的目录逃逸漏洞,以及@引用文件缺失防御性路径解析的问题,并将敏感路径黑名单改为不区分大小写。新版本还在macOS的沙盒模式下将~/.gitconfig设为只读,以防止模型对其进行篡改。这些修复解决了智能体在处理文件时可能逃离其预期工作目录的具体途径。
GitHub – google-gemini/gemini-cli 发布记录 ↗
工具2026-07-15
Claude Code 2.1.211 修复了聊天频道权限预览中的安全漏洞
2.1.211版本(7月15日)修复了一个漏洞:转发到聊天频道的权限预览中,不可见的Unicode字符——双向覆盖字符、零宽字符和伪造引号——可能篡改显示的工具输入内容,从而诱导用户批准不希望执行的命令。此外,自动模式现在不能再覆盖PreToolUse钩子对非沙盒化bash命令做出的明确“ask”(询问)决定。
claude-code Release v2.1.211 (GitHub) ↗ · Claude Code CHANGELOG.md (GitHub, anthropics/claude-code) ↗
模型2026-07-15
Thinking Machines发布开源编程模型Inkling
Mira Murati旗下初创公司Thinking Machines Lab于7月15日发布了其首个开源权重模型Inkling,这是一款总参数975B、激活参数41B的混合专家模型,上下文长度为1M token,训练数据包含45万亿个文本、图像、音频和视频token。在编程基准测试中,该模型在SWE-bench Verified上取得77.6%,在Terminal-Bench 2.1上取得63.8%,是迄今为止最强的美国开源模型。较小的预览版本Inkling-Small的激活参数为12B。
Thinking Machines Lab ↗ · TechCrunch ↗
工具2026-07-14
GPT-5.6 发布后,OpenAI Codex 用户增至 800 万
OpenAI 宣布 Codex 和 ChatGPT Work 的活跃用户合计达到 800 万——较 6 月初的 500 万大幅增长,这得益于 7 月 9 日发布的 GPT-5.6。Codex 负责人 Tibo Sottiaux 在 X 上宣布再次重置使用限制;通常的 5 小时速率限制暂时继续暂停。
Tibo Sottiaux (OpenAI): "We have reached 8M active users across Codex and ChatGPT Work" (X) ↗ · The New Stack: OpenAI hits 8 million Codex users — what developers need to know ↗
工具2026-07-14
GitHub Copilot 应用内新增专属安全审查命令
/security-review 命令现已作为公开预览版直接在 GitHub Copilot 应用中提供,可扫描正在进行的代码更改,检测注入、XSS、不安全的数据处理、路径遍历和弱加密等漏洞。结果按严重程度排序,修复可直接在 Copilot 中应用并重新检查。适用于 Free、Pro、Business 和 Enterprise 用户。
GitHub Changelog: Security reviews now available in the GitHub Copilot app ↗
安全2026-07-14
Grok Build CLI 曾将完整代码仓库连同密钥一起上传至 xAI
安全研究员 "cereblab" 通过网络流量分析显示,xAI 的编码工具 Grok Build(v0.2.93)会将完整的 Git 仓库(包括历史记录)未经处理地上传到 xAI 拥有的 Google Cloud 存储桶——甚至包括代理从未读取过的文件,以及未加密的 .env 密钥(如 API 密钥)。在一个测试仓库中,传输的数据量约为模型完成任务实际所需的 27,800 倍。xAI 随后通过服务器端开关悄然停止了上传;埃隆·马斯克承诺将彻底删除已上传的数据。
cereblab: What xAI Grok Build CLI actually sends to xAI – a wire-level analysis (Gist) ↗ · The Hacker News: Grok Build Uploaded Entire Git Repositories to xAI Storage, Not Just Files It Read ↗
论文2026-07-14
论文「Harness Handbook」提升编程智能体的规划质量
一篇于7月14日发表在arXiv上的论文提出了「Harness Handbook」:一种针对Codex和Terminus-2等智能体框架自动生成的、以行为为中心的表示方法,帮助开发者和智能体定位需要修改的正确代码。测试显示,相较于单纯的代码探索,编辑计划的胜率提升了10到19个百分点,同时规划所用的token减少了8.6%到12.7%。定位准确率(F1)最高提升18.8点,完全定位失败的情况最高减少25.9点。
arXiv:2607.13285 ↗
模型2026-07-12
Anthropic 再次延长 Fable 5 免费使用期——至 7 月 19 日
Anthropic 第三次延长了 Pro、Max、Team 和高级企业版订阅对 Claude Fable 5 的免费使用(原定 7 月 7 日,后延至 12 日,现为 19 日 23:59 PT)——最多可用每周额度的 50%,不额外收费,通过更新的支持文档公布。Fable 5 消耗额度比其他 Claude 模型更快;用完后需购买积分或切换模型。据 Anthropic 称,Fable 5 不会永久退出订阅——算力充足后将会回归。
BleepingComputer: Claude Fable 5 stays free for paid users until July 19 ↗
工具2026-07-11
Claude Code v2.1.207:Auto mode 现在在 Bedrock、Vertex AI 和 Foundry 上默认开启,无需选择加入
从 2.1.207 版本开始,Anthropic 默认为 AWS Bedrock、Google Vertex AI 和 Azure Foundry 用户也启用了 Claude Code 的自主 Auto mode,事先无需设置任何环境变量(flag)。此次更新还修复了 plugin hooks 中的一个 shell 注入漏洞,并把 Claude Opus 4.8 设为该场景下的默认模型。
claude-code Release v2.1.207 (GitHub) ↗ · Claude Code CHANGELOG.md (GitHub, anthropics/claude-code) ↗
工具2026-07-11
陶哲轩让 AI 智能体移植 27 年前的数学代码
菲尔兹奖得主陶哲轩让 AI 编程智能体把约两打老 Java 小程序(写于 1999 年前后)迁移成现代 JavaScript——只用了几个小时。智能体还在原始代码里发现了两个连陶哲轩本人都不知道的 bug;只引入了一个小的新 bug(用他的话说,代码质量上“打了个平手”)。他的结论:对于可视化辅助工具来说,这类错误的残余风险很低。
Terence Tao: Old and new apps, via modern coding agents ↗
工具2026-07-10
Cursor 3.11:Side Chats 与会话记录搜索
Cursor 3.11(7 月 10 日)引入“Side Chats”:在主对话旁开启并行、独立的智能体对话——通过 /side、/btw 或加号按钮——在不打断主智能体的情况下解决旁支问题。还新增了对历史智能体会话记录的搜索(Agents 窗口中按 Cmd+K),以及可直接连接 GitHub、GitLab 和 Azure DevOps 的项目选择器。
Cursor Changelog ↗
工具2026-07-10
Claude Code 桌面版内置浏览器上线
桌面版 Claude Code(v2.1.202–2.1.206)新增内置浏览器:Claude 可以打开文档、设计稿或任意网站,像处理本地开发服务器预览一样阅读和点击页面。浏览器运行在沙箱中,会话持久化可配置,安全分类器会审查在外部网站上的操作。另外:/doctor 现在是完整的安装体检,不仅能发现问题,确认后还能直接修复。
Claude Code Docs: What’s new (Week 28) ↗
安全2026-07-10
中国指控 Claude Code 存在后门,阿里巴巴禁用 Anthropic 工具
中国工业和信息化部(MIIT)在 2026 年 7 月 8 日发出警告,称 Claude Code 2.1.91 至 2.1.196 版本中存在一个“后门”,能在未经同意的情况下把位置和身份信息发送到远程服务器,并建议卸载或升级。阿里巴巴要求员工从 7 月 10 日起停止使用 Anthropic 的工具,改用 Qoder。Anthropic 表示,这其实是一个自 3 月起就在运行的实验性反滥用机制,针对的是转售商和模型蒸馏行为——Claude 在中国官方层面根本就不可用。相关代码早在 7 月 1 日就已经通过 pull request 移除。教训:把工具版本锁定,并认真看更新日志(changelog)。
CNBC:中国就 Anthropic Claude Code 的 AI 风险发出警告 ↗ · Tom's Hardware:阿里巴巴禁用 Anthropic 的 Claude Code ↗
安全2026-07-10
报道:AI 编码 agent 删除了生产数据库
根据 Tom's Hardware 的一篇报道,一个基于 Claude 的编码 agent(一个 Cursor 工具)在大约 9 秒内删除了一家公司的整个生产数据库——包括备份。教训:agent 需要最小权限访问、针对破坏性操作的确认门,以及独立存放的备份。
Tom's Hardware:AI 编码 agent 删除了公司数据库 ↗
工具2026-07-10
OpenAI 发布“ChatGPT Work”,直接对标 Claude Cowork
OpenAI 于 2026 年 7 月 10 日发布了“ChatGPT Work”——一款基于 GPT-5.6 的“超级应用”,把聊天机器人与其编码工具 Codex 结合起来,可以创建文档、演示文稿和网站。这被视为对 Anthropic 的“Claude Cowork”(2026 年 1 月发布,支持自主多步任务)的直接回应。产品将立即在网页端和移动端向 Pro/Enterprise/Edu 用户推出,Plus/Business 用户将在“未来几天内”跟进。背景:GPT-5.6 此前曾因安全担忧应美国政府要求而推迟发布——两家公司正在激烈争夺企业客户。
CGTN:OpenAI 发布超级应用,与 Anthropic 的竞争加剧 ↗
论文2026-07-10
为什么很多编码基准测试具有误导性
一篇立场论文指出,传统的编码基准测试把模型本身的表现和周围 agent 基础设施的表现混在一起算成一个分数,无法诊断问题到底出在哪里。而且这些测试常常惩罚那些偏离预期路径、但其实同样有效的替代解法。实用建议:选工具时不要盲目相信排行榜,用你自己的实际任务去测试。
arXiv: Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering ↗
论文2026-07-10
研究:AI 编码 agent 在任务不明确时很少主动提问
ClarEval 基准测试评估编码 agent 在指令含糊时是否会主动提出澄清性问题,而不是直接埋头写代码。结果显示:即使是顶尖模型,也经常无法在恰当的时机提出恰当的澄清问题。实用建议:把提示词写得尽量精确,如果 agent 面对模糊任务却不提问就直接动手,你应该保持警惕。
arXiv: ClarEval: A Benchmark for Evaluating Clarification Skills of Code Agents under Ambiguous Instructions ↗
论文2026-07-10
研究:结果好还不够,过程也必须保持可控
ProcCtrlBench 不仅评估编码 agent 是否得到了正确的最终结果,还评估整个过程是否保持可解释、可中断、可纠正、可撤销——通过 11 种不同的过程缺陷类型来衡量。这与生产数据库被删除等事件给出的教训一致:不要只盯着最终产出,在放手让 agent 执行之前,先设置好停止点和撤销方案。
arXiv: ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents ↗
模型2026-07-09
Meta 发布 Muse Spark 1.1,并推出自家模型 API
Meta 公布了 Muse Spark 1.1,这是一个面向智能体编程和工具调用任务的模型,拥有 100 万 token 的上下文,可以把任务委派给子智能体。通过新推出的、与 OpenAI 兼容的 Meta Model API,开发者首次可以付费访问 Meta 的模型。
Meta AI 博客:介绍 Muse Spark 1.1 与 Meta Model API ↗ · SiliconANGLE:Meta 发布旗舰模型 Muse Spark 1.1,带来多智能体升级 ↗
工具2026-07-09
Claude Code 2.1.197:后台 agent 自动提交,新增 /doctor 检查
Claude Code v2.1.197 引入了后台 agent,能自动执行 commit、push,并打开 draft pull request。此外还新增了 /doctor 配置检查,以及针对临时性网络错误的自动重试(带 backoff)机制。
Releasebot:Claude Code 更新记录 ↗
MCP2026-07-09
MCP 规范 2026-07-28 版进入候选发布阶段
即将发布的 MCP 规范 2026-07-28 版自 2026 年 5 月 21 日起锁定为候选发布版(Release Candidate),正式版将于 2026 年 7 月 28 日发布。核心协议改为无状态(取消会话握手和 Mcp-Session-Id),并新增在沙箱 iframe 中运行交互界面的“MCP Apps”。Tasks 移入扩展,并引入正式的弃用政策:从弃用到移除至少间隔 12 个月。注意:此版本包含不兼容变更。
MCP 博客:2026-07-28 候选版本 ↗
模型2026-07-09
OpenAI 发布 GPT-5.6 系列模型
OpenAI 公布了 GPT-5.6 系列:旗舰型号 Sol(每百万 token 5 美元/30 美元)、中端型号 Terra(2.5 美元/15 美元)、最便宜的 Luna(1 美元/6 美元)。据 Sam Altman 介绍,Sol 在编码任务上的 token 效率比之前提升了 54%。OpenAI 宣称其 Coding Agent Index 得分为 80,比 Claude Fable 5 高 2.8 分,而用的输出 token 还不到一半。
TechCrunch:OpenAI 发布 GPT-5.6 系列 ↗
安全2026-07-08
研究人员演示针对 Claude Code 和 Codex CLI 的"Friendly Fire"漏洞利用
AI Now Institute 发布了一个概念验证(PoC):在第三方代码库中放入精心构造的文件,能诱使 Claude Code(Auto mode)和 OpenAI Codex CLI 在所谓的安全检查过程中,偷偷执行恶意代码。目前尚未发现在野攻击案例,但这个手法不需要插件或 MCP 服务器,并且能影响两家厂商的多个模型。
Friendly Fire: Hijacking Defensive Cyber AI Agents for Remote Code Execution (AI Now Institute) ↗ · The Hacker News:为拦截恶意代码而生的顶级 AI agent,也可能被骗去执行恶意代码 ↗
模型2026-07-08
Grok 4.5:SpaceXAI 与 Cursor 联合训练的模型发布
SpaceXAI 发布了 Grok 4.5——7 月 8 日宣布,9 日起公开可用。马斯克称其为“Opus 级”模型,“大致与 Opus 4.7 相当,但快得多”;定价为输入每百万 tokens 2 美元、输出 6 美元(Opus 4.7 为 5/25 美元)。据 Cursor 官方博客,这是一个由 Cursor 与 SpaceXAI 联合训练的 MoE(专家混合)模型,训练数据包含数万亿来自真实 Cursor 使用场景的 tokens,现已在 Cursor 的桌面端、网页端、iOS、CLI 和 SDK 上可用。
TechCrunch: SpaceXAI releases Grok 4.5 ↗ · Cursor Blog: Introducing Grok 4.5 ↗ · x.ai: Introducing Grok 4.5 ↗
工具2026-07-06
智谱发布 ZCode,面向 GLM-5.2 的编码 harness
智谱/Z.ai 发布了“ZCode”,一个面向 GLM-5.2 的编码 harness——GLM-5.2 是一个采用 MIT 许可证的开放权重模型,上下文长度达 100 万 token。在当前中国与 Anthropic 之间紧张关系的背景下,智谱把这款工具定位为 Claude Code 的直接竞品。作为促销,提供 500 万免费 token,编码套餐起步价约为每月 16 美元。
SCMP:智谱 AI 发布面向 GLM-5.2 的 harness ↗
模型2026-07-01
Claude Fable 5:出口管制解除,重新面向全球开放
Anthropic 于 2026 年 6 月 9 日发布了 Fable 5 和 Mythos 5,但亚马逊的研究人员发现了一个越狱方法(该模型能识别软件漏洞并演示利用方式)后,美国政府在 6 月 12 日实施了出口管制。管制已于 6 月 30 日解除,自 7 月 1 日起 Fable 5 重新面向全球开放——搭配新的安全分类器,能拦截 99% 以上的此类攻击,被拦截的请求会转发给 Opus 4.8。Anthropic 认为这个越狱属于边缘案例,因为更弱的模型也会给出类似结果——教训是:永远不要把应用死死绑定在单一模型上。
Anthropic:重新部署 Fable 5 ↗
工具2026-06-18
Google 停止 Gemini CLI 和 Code Assist for GitHub
Google 已于 2026 年 6 月 18 日停止了 Gemini CLI 和 Gemini Code Assist for GitHub(Code Assist:6 月 18 日起弃用,7 月 17 日完全下线)。继任产品是 Antigravity CLI。Google 给出的理由是需求正转向拥有统一后端的多 agent 方案——对 CI/CD 流水线的启示是:把工具调用抽象出来,缓冲这类依赖带来的风险。
9to5Google:Gemini CLI 即将下线 ↗
工具2026-06-16
SpaceX 以 600 亿美元收购 Cursor 开发商 Anysphere
SpaceX 于 2026 年 6 月 16 日宣布,将以价值 600 亿美元的股票收购 Anysphere(也就是 Cursor 的开发商)——就在 SpaceX 自己上市几天之后(是 SpaceX 上市,不是 Cursor)。Cursor 此前的估值约为 290 亿美元。交易预计在 2026 年第三季度完成。
TechCrunch:SpaceX 将以 600 亿美元收购 Cursor ↗
模型2026-05-28
Claude Opus 4.8 发布
Anthropic 于 2026 年 5 月 28 日发布了 Claude Opus 4.8。新特性包括作为研究预览版的“Dynamic Workflows”(Claude Code 可以编排数百个并行 subagent)和 Effort Controls,编码相关的 bug 也比 4.7 明显减少。价格维持在每百万 token 5 美元/25 美元,另外新增了一个每百万 token 10 美元/50 美元的 Fast Mode。
Anthropic:Claude Opus 4.8 ↗