生猛活海鲜大排档

Search posts…

AI/LLM29

202607 Agent Guard

202607 Agent Guard

Benchmark 【2025-03-06】【McGill / Mila / Cohere 等;Siva Reddy、Esin Durmus 等】【arXiv 预印本】SafeArena: Evaluating the Safety of Autonomous Web Agents 摘要:这篇提出 SafeArena,用来评估 web agents 对 de...

AI/LLM 2026 Jul 01 26 min read
202607 Agent Safety Benchmarks

202607 Agent Safety Benchmarks

Benchmarks / Evals / Audits Anthropic 【2025-03-13】【Anthropic】【官方研究博客】Auditing language models for hidden objectives:Anthropic 将 alignment audit 具体化为实验流程:故意训练带隐藏目标的模型,再让审计团队盲查;是后续 A...

AI 2026 Jul 01 20 min read
ccauto-00-index

CC Auto Mode - Auto Mode 安全架构分析报告系列

Auto Mode 安全架构系列总索引:架构图、报告目录、术语表与阅读顺序。

AI 2026 Mar 31 5 min read
ccauto-01-entrypoint

CC Auto Mode 01 - Entry Point 总览

权限模式体系、三层状态管理、入口矩阵与首次同意弹窗(auto mode 入口总览)。

AI 2026 Mar 31 6 min read
ccauto-02-classifier

CC Auto Mode 02 - 安全判定分类管道

两阶段分类器管道:快路径、白名单、Stage 1/2、transcript 构建与缓存策略。

AI 2026 Mar 31 31 min read
ccauto-03-permission-stripping

CC Auto Mode - 03 - 权限剥离与信任边界

进入 auto 时的危险 allow 规则剥离、stash/restore 与敏感路径信任边界。

AI 2026 Mar 31 5 min read
ccauto-04-multi-agent

CC Auto Mode - 04 - 多 Agent 安全交接

多 Agent 场景下的 Outbound/Inbound 分类、子进程继承与 AFK header latch。

AI 2026 Mar 31 10 min read
ccauto-05-gate-circuit-breaker

CC Auto Mode 05 - 门禁、熔断与异步踢出

同步/异步门禁、GrowthBook 熔断、kickout 变换与模型支持判定。

AI 2026 Mar 31 8 min read
ccauto-06-configuration

CC Auto Mode 06 - 配置体系与可定制 Slot

分类器 prompt 三 Slot(allow / soft_deny / environment)、设置合并与 CLI 子命令。

AI 2026 Mar 31 4 min read
ccauto-07-deny-and-resilience

CC Auto Mode 07 - Deny-and-Continue 韧性设计

Deny-and-Continue:拒绝后的 tool_result 反馈、denial tracking 阈值与 fail-closed/open。

AI 2026 Mar 31 7 min read
ccauto-A-单次请求的上下文整形流水线

CC Auto Mode 附录 A - 单次请求的上下文整形流水线

附录 A:queryLoop 出站前 budget/snip/microcompact/collapse/autocompact 与 Harness 边界。

AI 2026 Mar 31 15 min read
ccauto-B-长会话压缩与多线程状态隔离

CC Auto Mode 附录 B - 长会话压缩与多线程状态隔离

附录 B:autoCompact、Session Memory、PTL、cached MC 隔离与 Teammate 沙箱。

AI 2026 Mar 31 13 min read
ccauto-C-分类器边界之外的纵深防御

CC Auto Mode 附录 C - 分类器边界之外的纵深防御

附录 C:subprocessEnv、输入净化、通道 safetyCheck、系统提示与纵深时间轴速查。

AI 2026 Mar 31 13 min read
Envisioning a Human Like AI

Envisioning a Human Like AI:A Context-Centric Architecture

以动态上下文工程为核心的类人 Agent 随笔:记忆裁剪、人格、工具调用与「灵魂在文本中流动」。

AI 2026 Mar 01 31 min read
2026.01.15

2026.01.15

毕设课题与大厂论文「撞车」的复杂心情,以及造数据、筛特征与摸漏洞的断续实验笔记。

AI 2026 Jan 15 1 min read
Advice From Anthropic

Advice From Anthropic

Anthropic 摘抄:基础研究背景如何转向 LLM 可解释性——代码能力、开源贡献与 MechInterp 学习路径。

AI 2026 Jan 01 1 min read
Anti-Sycophancy Prompts

Anti-Sycophancy Prompts

反谄媚提示:通过假装稿件出自他手等方式,诱导模型给出真正尖锐、建设性的批评。

AI 2026 Jan 01 1 min read
Latent Memory 调研

Latent Memory 调研

隐空间推理(Latent Reasoning)的底层架构与多路径并发算法调研。

AI 2026 Jan 01 68 min read
LLM Safety 资源

LLM Safety 资源

LLM 安全与对齐信息源指南:顶会、Anthropic/OpenAI/DeepMind/学界实验室与社区仓库索引。

AI 2025 Dec 01 4 min read
文档

文档

科研用链接合集:HuggingFace、ModelScope、TransformerLens、SAELens 与 pip 镜像等。

AI 2025 Dec 01 1 min read
202511 Agentic Safety

202511 Agentic Safety

Agent 强化学习与对齐:记忆架构、勒索案例、工具滥用与相关论文链接汇编。

AI 2025 Nov 01 1 min read
后训练

后训练

PPO 核心思想:裁剪概率比限制策略更新步长,配合 GAE 优势与多轮 epoch 优化的速记推导。

AI 2025 Nov 01 3 min read
Interpretability

Interpretability

https://arxiv.org/abs/2407.02646 https://arxiv.org/abs/2501.16496

AI/LLM 2025 Sep 01 1 min read
Interpretable Interpretability & LLM Safety

Interpretable Interpretability & LLM Safety

可解释性如何服务 LLM 安全:基础模型、微调、MechInterp 工具与对齐资料索引长文。

AI 2025 Sep 01 13 min read
SAE 特征筛选

SAE 特征筛选

用正负样本在 SAE 特征上的平均激活差筛选与安全相关特征,并讨论方向性与统计检验。

AI 2025 Aug 01 12 min read
Transformer

Transformer

把自注意力写成集合上的动态加权聚合:QKV、缩放点积、多头与位置编码等推导长文。

AI 2025 Jul 01 29 min read
2024.12.21 作为llm tcs双料特工,绝对是强利益

2024.12.21 作为llm tcs双料特工,绝对是强利益

作为llm/tcs双料特工,绝对是强利益相关。2022自己选专业的时候就写过一篇博客。有空再更新一下续集吧

AI 2024 Dec 21 2 min read
关于LLM的胡扯

关于LLM的胡扯

面向非专业人士梳理 GPT、预训练与 Transformer 概念,讨论文本建模边界、数学能力与常见舆论误区。

AI 2023 Jul 12 25 min read
2022.12.05 各位看好自己的饭碗

2022.12.05 各位看好自己的饭碗

各位看好自己的饭碗 #ChatGPT

AI 2022 Dec 05 1 min read
笔记 113 posts 碎碎念 435 posts 流水账 105 posts 散文 10 posts