AI/LLM29
202607 Agent Guard
Benchmark 【2025-03-06】【McGill / Mila / Cohere 等;Siva Reddy、Esin Durmus 等】【arXiv 预印本】SafeArena: Evaluating the Safety of Autonomous Web Agents 摘要:这篇提出 SafeArena,用来评估 web agents 对 de...
202607 Agent Safety Benchmarks
Benchmarks / Evals / Audits Anthropic 【2025-03-13】【Anthropic】【官方研究博客】Auditing language models for hidden objectives:Anthropic 将 alignment audit 具体化为实验流程:故意训练带隐藏目标的模型,再让审计团队盲查;是后续 A...
CC Auto Mode - Auto Mode 安全架构分析报告系列
Auto Mode 安全架构系列总索引:架构图、报告目录、术语表与阅读顺序。
CC Auto Mode 01 - Entry Point 总览
权限模式体系、三层状态管理、入口矩阵与首次同意弹窗(auto mode 入口总览)。
CC Auto Mode 02 - 安全判定分类管道
两阶段分类器管道:快路径、白名单、Stage 1/2、transcript 构建与缓存策略。
CC Auto Mode - 03 - 权限剥离与信任边界
进入 auto 时的危险 allow 规则剥离、stash/restore 与敏感路径信任边界。
CC Auto Mode - 04 - 多 Agent 安全交接
多 Agent 场景下的 Outbound/Inbound 分类、子进程继承与 AFK header latch。
CC Auto Mode 05 - 门禁、熔断与异步踢出
同步/异步门禁、GrowthBook 熔断、kickout 变换与模型支持判定。
CC Auto Mode 06 - 配置体系与可定制 Slot
分类器 prompt 三 Slot(allow / soft_deny / environment)、设置合并与 CLI 子命令。
CC Auto Mode 07 - Deny-and-Continue 韧性设计
Deny-and-Continue:拒绝后的 tool_result 反馈、denial tracking 阈值与 fail-closed/open。
CC Auto Mode 附录 A - 单次请求的上下文整形流水线
附录 A:queryLoop 出站前 budget/snip/microcompact/collapse/autocompact 与 Harness 边界。
CC Auto Mode 附录 B - 长会话压缩与多线程状态隔离
附录 B:autoCompact、Session Memory、PTL、cached MC 隔离与 Teammate 沙箱。
CC Auto Mode 附录 C - 分类器边界之外的纵深防御
附录 C:subprocessEnv、输入净化、通道 safetyCheck、系统提示与纵深时间轴速查。
Envisioning a Human Like AI:A Context-Centric Architecture
以动态上下文工程为核心的类人 Agent 随笔:记忆裁剪、人格、工具调用与「灵魂在文本中流动」。
2026.01.15
毕设课题与大厂论文「撞车」的复杂心情,以及造数据、筛特征与摸漏洞的断续实验笔记。
Advice From Anthropic
Anthropic 摘抄:基础研究背景如何转向 LLM 可解释性——代码能力、开源贡献与 MechInterp 学习路径。
Anti-Sycophancy Prompts
反谄媚提示:通过假装稿件出自他手等方式,诱导模型给出真正尖锐、建设性的批评。
Latent Memory 调研
隐空间推理(Latent Reasoning)的底层架构与多路径并发算法调研。
LLM Safety 资源
LLM 安全与对齐信息源指南:顶会、Anthropic/OpenAI/DeepMind/学界实验室与社区仓库索引。
文档
科研用链接合集:HuggingFace、ModelScope、TransformerLens、SAELens 与 pip 镜像等。
202511 Agentic Safety
Agent 强化学习与对齐:记忆架构、勒索案例、工具滥用与相关论文链接汇编。
后训练
PPO 核心思想:裁剪概率比限制策略更新步长,配合 GAE 优势与多轮 epoch 优化的速记推导。
Interpretability
https://arxiv.org/abs/2407.02646 https://arxiv.org/abs/2501.16496
Interpretable Interpretability & LLM Safety
可解释性如何服务 LLM 安全:基础模型、微调、MechInterp 工具与对齐资料索引长文。
SAE 特征筛选
用正负样本在 SAE 特征上的平均激活差筛选与安全相关特征,并讨论方向性与统计检验。
Transformer
把自注意力写成集合上的动态加权聚合:QKV、缩放点积、多头与位置编码等推导长文。
2024.12.21 作为llm tcs双料特工,绝对是强利益
作为llm/tcs双料特工,绝对是强利益相关。2022自己选专业的时候就写过一篇博客。有空再更新一下续集吧
关于LLM的胡扯
面向非专业人士梳理 GPT、预训练与 Transformer 概念,讨论文本建模边界、数学能力与常见舆论误区。
2022.12.05 各位看好自己的饭碗
各位看好自己的饭碗 #ChatGPT