Deep

AI代理无视你的控制

Deep

AI代理无视你的控制

AI代理正以超乎预期的速度渗透企业核心业务,它们不仅是工具,更是自主执行的数字实体。然而,绝大多数组织仍未意识到,传统的安全控制模型——基于身份验证、访问权限与审计日志的框架——在面对这种毫秒级、跨系统的自主行为时,已近乎失效。问题的根源不在于代理绕过了控制,而在于它们“合法地”在控制内运行,却无法被证明行为是否适当。这份报告揭示了AI代理带来的结构性安全盲区,并拆解了身份、权限、监控与控制验证四大关键失效点。 从被动工具到自主执行者:AI代理颠覆了谁的安全假设 网络安全行业过去数年一直专注于提升可见性:仪表盘不断优化,检测工具日益成熟,遥测数据量激增。然而,如今最重大的新兴风险并非隐藏的恶意软件或未知漏洞,而是AI代理正以组织无法完全理解、无法清晰盘点、更无法有效管控的方式,跨环境自主运作。这不再仅仅是新增一个软件类别的问题——它代表了自主数字行为体的引入:它们与身份系统、API、SaaS平台、云环境及业务流程交互,其运作逻辑完全脱离了传统控制模型所依赖的假设:以人为中心、可预测的工作流、相对静态的权限模型以及较慢的操作周期。 四大控制失效点:身份模糊、权限放大、监控噪音与

By Kexin
共享AI代理知识平台打破 AI 代理知识孤岛

Deep

共享AI代理知识平台打破 AI 代理知识孤岛

Mozilla.ai 近日正式推出 CQ Exchange,一个旨在打破 AI 代理之间知识孤岛的集中式共享平台。该服务面向开发者和企业,允许代理通过私有命名空间和个人知识单元(KU)实现跨地点、跨工具的知识访问,同时首创“全球公共知识库”(Global Commons)机制,鼓励社区共建。从本地存储到云端共享,CQ Exchange 试图为 AI 代理生态构建一套类“Stack Overflow”的知识沉淀与复用体系,有望从根本上改变基于代理的应用程序开发方式。 CQ Exchange 三大核心能力:私有空间、公共库与多端接入 与以往将知识碎片化存储在本地或自托管服务器不同,CQ Exchange 在云端提供了一个统一的知识存储和检索服务。所有代理均可通过 GitHub 或 Google 认证,访问其专属的私有命名空间内的知识单元(Knowledge Units, KU),实现跨机器、跨 session

By Bonan
GitHub内部仓库遭VS Code扩展入侵

Deep

GitHub内部仓库遭VS Code扩展入侵

全球最大的代码托管平台GitHub于5月18日检测到一起内部仓库遭未授权访问的安全事件。攻击者通过一款被投毒的第三方VS Code扩展渗透了员工设备,声称已窃取约3800个内部仓库的数据。GitHub官方确认,目前仅内部系统受到影响,客户的企业、组织和代码库等敏感数据未被波及,但部分内部仓库中包含了客户支持会话摘录。事件发生后,GitHub立即下架恶意扩展并隔离了涉事设备,随后优先轮换了高风险的密钥,并持续监控基础设施。 根据GitHub官方博客披露,这起入侵的起点是一个由第三方发布的、含有恶意代码的VS Code扩展。该扩展被安装到一名GitHub员工的开发环境中,攻击者借此获得了访问内部仓库的权限。GitHub在发现异常后,迅速从市场下架了该恶意版本,并将受影响的员工设备进行隔离。调查表明,攻击活动仅限于对GitHub内部仓库的窃取,尚未发现任何客户数据遭到泄露的证据。攻击者声称窃取了约3800个仓库,这一数字与GitHub正在进行的调查吻合。 值得注意的是,虽然客户的核心数据未受影响,但部分被窃的内部仓库中确实包含了客户支持交互的摘录。GitHub表示,如果后续调查发现任何对

By Kexin
谷歌为Gemini API添加托管代理

Deep

谷歌为Gemini API添加托管代理

在Google I/O 2026大会上,Google宣布为其AI代理开发平台带来重大升级,核心是在Gemini API中推出“Managed Agents”(托管代理)功能。这一新服务旨在将AI代理的开发从传统的“提问-响应”模式,彻底转向“执行-行动”模式。通过提供完全托管的执行环境(包括安全Linux沙箱、工具调用和代码执行基础设施),Google让开发者能够通过单一API调用即可启动一个能够自主规划、推理、调用工具并执行代码的AI代理,从而摆脱自行搭建复杂后端的负担。此举标志着AI代理从演示原型向生产级部署的跨越,而驱动这一切的底层模型正是Google于前一天发布的超高效模型Gemini 3.5 Flash。 Managed Agents:沙箱与基础设施的全面抽象 根据Google官方博客,Managed Agents是一个由Google全权提供运行环境的系统,涵盖了AI代理运行所需的执行环境、工具调用以及代码执行沙箱。传统上,在生产环境中部署AI代理要求开发者自行准备代码执行沙箱、文件管理、外部工具集成以及处理多进程的执行基础设施。Google表示,Gemini API

By Bonan
港中大浙大研报:AI Agent记忆只是“备忘录”

Deep

港中大浙大研报:AI Agent记忆只是“备忘录”

香港中文大学与浙江大学联合发布的一篇立场论文,在学术界引发了一场关于AI Agent记忆本质的深层讨论。论文以认知科学和数学理论为武器,尖锐指出当前主流Agent记忆方案——从向量数据库到RAG、Scratchpad——本质上只是“备忘录”而非真正的记忆,存在信息量不等于能力、泛化天花板与记忆投毒三大结构性缺陷。论文提出借助神经科学中的互补学习系统理论,构建“海马体+新皮层”双系统架构,让Agent不仅能存储情景,更能将经验抽象为可泛化的规则写入权重,避免越用越蠢的窘境。 从“备忘录”到“真记忆”:Agent认知困境的根源 论文将当前四类主流记忆方案——向量存储、检索增强生成(RAG)、便签本(Scratchpad)与上下文窗口管理——统称为“备忘录(Memo)”。其底层逻辑均为“存储+检索”,与人类将知识内化于心的“真记忆(True Memory)”存在本质差异。研究者指出,基于检索的泛化依赖相似案例的覆盖度,而基于权重的泛化能将经验抽象为规则,应用于从未见过的输入。人类学习语言时能内化语法规则并生成新句子,而Agent只是机械地背诵例句。论文引用神经科学中的互补学习系统理论(

By Bonan
AI智能体开发:多数团队为何失败

Deep

AI智能体开发:多数团队为何失败

AI代理已成科技界最炙手可热的赛道,但绝大多数团队的落地尝试都以失败告终。问题并非技术本身不可行,而是从一开始就采取了错误的方法——从炫目的演示出发而非工程架构出发。本文基于深度行业调研,拆解AI代理的真正定义、失败模式、生产级开发流程,并给出甄选合作伙伴的实用指南,帮助从业者避开“演示火爆、生产崩盘”的陷阱。 AI代理不是聊天机器人:定义、核心组件与常见误区 一个AI代理是能够感知环境、自主决策、执行行动并根据反馈调整的系统,无需人类逐步骤指示。它不同于回答问题的聊天机器人,也不同于按计划运行的脚本,而是能够推理目标、分解步骤、利用可用工具执行并处理异常情况的自主单元。其关键组件包括:LLM核心(负责推理与规划)、工具集成层(API、数据库、浏览器等执行能力)、记忆系统(短期上下文与长期存储)、编排层(任务规划与错误处理)以及评估框架(测试与监控)。多数团队只关注LLM核心,而在其他组件上投资不足,这正是代理失败的主因。 失败模式与正确路径:先定义任务边界,再写一行代码 典型的失败路线是:团队看到令人印象深刻的演示,选择LangChain、AutoGen或CrewAI等框

By Yuchen
AI Agent成熟度四层次:避免构建混乱

Deep

AI Agent成熟度四层次:避免构建混乱

在AI Agent开发热潮中,大量团队陷入“多智能体编排”的泥潭,产出难以维护的“slop”。近日,Ara Khan在AI Engineer Europe大会上的演讲提出了一个四阶段成熟度模型,警告开发者警惕推理时延与数据隔离两大陷阱,并指出从框架引入到云端生产级部署的进化路径。该框架由Google DeepMind、Braintrust和WorkOS赞助,强调简单性、可测试性与横向扩展能力,为构建真正可靠的AI Agent提供了系统性蓝图。 从框架依赖到自建系统:AI Agent成熟度的前两大层级 Ara Khan将AI Agent的成熟度划分为四个递进层级。在第一级“使用框架”中,开发者借助LangChain、LangGraph、CrewAI、AutoGen或LlamaIndex等现有工具快速上手,理解智能代理的基本架构与表面运作原理。然而,这一阶段往往隐藏着DeepMind所警告的推理时延(后台等待推理完成导致效率低下)和数据隔离(不同代理基于相同数据训练引发合并冲突)两大问题。 第二级“自建代理”要求工程师从零开始构建,聚焦于架构设计、模块化与模型独立性。开发者需要实现

By Danfeng
Anthropic开源金融AI Skill包

Deep

Anthropic开源金融AI Skill包

在华尔街,投行分析师的噩梦莫过于周五下午五点接到MD的指令:“周一早上要一份pitch deck,把comps拉一下,DCF跑一遍。”这个周末必定泡汤。然而,Anthropic近日在GitHub上开源了一个名为claude-for-financial-services的全新仓库,直接瞄准了投行、股票研究、私募股权和财富管理这四条华尔街最昂贵的赛道。整个工具包以Apache 2.0协议开放,采用Markdown加YAML格式,无任何复杂构建步骤,fork即改。这不仅仅是工具的开源,更是Anthropic试图为金融AI生产力立下行业标准的信号。 11个端到端Agent重塑投行工作流 整个仓库分为两层:11个自包含的端到端Agent,以及7个垂直行业的底层Skill包。Agent层无需预先安装繁琐依赖,直接跑完整流水线。其中最引人注目的几个Agent包括: * Pitch Agent:输入可比公司、先例交易、LBO假设,直接输出带品牌格式的pitch deck。原本需要两天的工作被压缩为一条命令。 * Model Builder:直接在Excel中运行DCF、LBO和三表模型。不

By Bonan
2026技术趋势:AI从预期到价值

Deep

2026技术趋势:AI从预期到价值

2026年,企业级人工智能正从“高预期”的神坛走向“可交付价值”的地面。Globant最新发布的《2026年技术趋势报告》揭示了一个关键拐点:75%的企业正在尝试AI智能体,但仅有15%真正部署了端到端自主决策系统;61%的应用仍停留在邮件撰写、会议纪要等局部自动化层面。与此同时,量子通信、多功能机器人、环境智能与AI原生安全正形成叠加效应,未来的竞争不再是单点技术突破,而是治理、数据、组织协同的系统工程能力。以下是报告的核心洞察。 Agentic AI落地落差:61%应用停留在局部自动化 报告数据显示出明显的“尝试-落地”鸿沟。75%的企业正在AI智能体,但端到端、具备自主决策能力的系统部署率仅15%。当前61%的应用仍局限于邮件撰写、会议纪要等低价值自动化场景,无法形成结构性生产力提升。Globant指出,当企业IT战略与业务战略高度一致时,AI被认为具有变革价值的概率提升至1.6倍——组织协同是释放ROI的核心变量。2026年被视为AI从“概念验证”迈向“规模落地”的关键拐点,

By Bonan
ClaudeCode论文流水线开源获6.4k星

Deep

ClaudeCode论文流水线开源获6.4k星

一款名为 academic-research-skills(ARS)的开源项目在 GitHub 上迅速蹿红,斩获 6.4k Stars,成为学生党撰写论文的“神器”。该项目深度整合了 Anthropic 的 Claude Code,将论文全流程——从文献调研、写作、审稿到定稿——打包成一套可复用的智能体技能包。不同于简单的提示词组合,ARS 在底层设计中嵌入了引用核验、完整性闸门、反谄媚协议以及三层数据隔离等机制,试图系统性解决 AI 辅助学术研究中的幻觉、讨好与不可复现等核心痛点。项目作者是来自中国台湾的开发者 Edward Cheng-I Wu,他通过 300 多次迭代,展示了如何让 AI 真正成为“副驾驶”而非“飞行员”。 6.4k Stars:从研究到发表的完整流水线 ARS 的核心由四个技能模块构成,

By Yuchen
2026最佳AI代理:按用例排名对比

Insights

2026最佳AI代理:按用例排名对比

2026年,AI代理市场迎来关键转折。根据Ramp最新发布的AI指数,Anthropic在美国5万家企业中的工作场所采用率达到34.4%,而OpenAI以32.3%紧随其后。这组数据标志着AI工具正从单纯的“问答引擎”转向能够独立处理编码、客户支持、自动化及销售任务的智能代理。企业不再满足于聊天机器人,而是追求能完成多步骤工作流、连接业务工具并自主决策的AI代理。面对日益拥挤的市场,如何根据实际工作流程、技术水平和预算选择最适合的平台,成为CTO和业务负责人面临的核心课题。 Anthropic以34.4%企业采用率领先OpenAI,AI代理加速替代传统聊天机器人 Gartner预测,到2026年底,40%的企业应用将包含特定任务的AI代理,而这一数字在2025年还不足5%。这一趋势在最新市场数据中得到印证:Anthropic凭借Claude Code等开发者工具在企业级场景中建立优势,OpenAI则通过ChatBot等产品维持广泛渗透。两者的竞争已从模型能力延伸到代理平台的完整性和易用性。 AI代理与传统聊天机器人的本质区别在于“行动力”。聊天机器人被动回答用户输入,而AI代理

By Bonan
GitHub Copilot桌面预览发布

Latest

GitHub Copilot桌面预览发布

GitHub 宣布推出全新独立桌面客户端 GitHub Copilot App 的技术预览版,标志着这款明星 AI 编程助手正式从 VS Code 扩展升级为自主代理式开发平台。新应用支持 macOS、Windows 及 Linux 系统,能够从 GitHub Issue 出发,自主完成代码编写、拉取请求创建与合并的全流程操作。在 Anthropic 发布 Claude Code 桌面客户端、Cursor 3 推出并行代理窗口的激烈竞争背景下,GitHub 将核心优势锚定在与既有开发工作流(Issues、PRs、分支保护规则)的深度集成,意图重新定义 AI 编程代理的体验边界。 独立桌面应用:从编辑器扩展到全流程代理 与以往作为 VS Code 插件的形态不同,GitHub Copilot

By Yuchen