AI/Agent12
202607 Agent Safety Benchmarks
Benchmarks / Evals / Audits Anthropic 【2025-03-13】【Anthropic】【官方研究博客】Auditing language models for hidden objectives:Anthropic 将 alignment audit 具体化为实验流程:故意训练带隐藏目标的模型,再让审计团队盲查;是后续 A...
CC Auto Mode - Auto Mode 安全架构分析报告系列
Auto Mode 安全架构系列总索引:架构图、报告目录、术语表与阅读顺序。
CC Auto Mode 01 - Entry Point 总览
权限模式体系、三层状态管理、入口矩阵与首次同意弹窗(auto mode 入口总览)。
CC Auto Mode 02 - 安全判定分类管道
两阶段分类器管道:快路径、白名单、Stage 1/2、transcript 构建与缓存策略。
CC Auto Mode - 03 - 权限剥离与信任边界
进入 auto 时的危险 allow 规则剥离、stash/restore 与敏感路径信任边界。
CC Auto Mode - 04 - 多 Agent 安全交接
多 Agent 场景下的 Outbound/Inbound 分类、子进程继承与 AFK header latch。
CC Auto Mode 05 - 门禁、熔断与异步踢出
同步/异步门禁、GrowthBook 熔断、kickout 变换与模型支持判定。
CC Auto Mode 06 - 配置体系与可定制 Slot
分类器 prompt 三 Slot(allow / soft_deny / environment)、设置合并与 CLI 子命令。
CC Auto Mode 07 - Deny-and-Continue 韧性设计
Deny-and-Continue:拒绝后的 tool_result 反馈、denial tracking 阈值与 fail-closed/open。
CC Auto Mode 附录 A - 单次请求的上下文整形流水线
附录 A:queryLoop 出站前 budget/snip/microcompact/collapse/autocompact 与 Harness 边界。
CC Auto Mode 附录 B - 长会话压缩与多线程状态隔离
附录 B:autoCompact、Session Memory、PTL、cached MC 隔离与 Teammate 沙箱。
CC Auto Mode 附录 C - 分类器边界之外的纵深防御
附录 C:subprocessEnv、输入净化、通道 safetyCheck、系统提示与纵深时间轴速查。