AI52
202607 Agent Safety Benchmarks
Benchmarks / Evals / Audits Anthropic 【2025-03-13】【Anthropic】【官方研究博客】Auditing language models for hidden objectives:Anthropic 将 alignment audit 具体化为实验流程:故意训练带隐藏目标的模型,再让审计团队盲查;是后续 A...
202607 Socioaffective Alignment
https://www.emergentmind.com/topics/human-ai-companionship The Siren Song of LLMs: How Users Perceive and Respond to Dark Patterns in Large Language Models https://iclr.cc/virtual/...
Scaling Laws
Chinchilla Scaling Laws How to Scale Your Model
浮点数
浮点数标准(主要是 IEEE 754)的定义并非随意的工程拍脑袋,而是一场数学严谨性、硬件执行效率和数值稳定性之间的极限拉扯。 该标准的主要设计者 William Kahan(因此获得图灵奖)在制定标准时,核心目标是为了解决当时科学计算中跨平台结果不一致,以及数值计算极易由于溢出或舍入导致系统崩溃的问题。 这种将32位(以单精度 float 为例)划分为 1...
2026.04.21 如图
QQ 空间说说迁入:图片记录。
CC Auto Mode - Auto Mode 安全架构分析报告系列
Auto Mode 安全架构系列总索引:架构图、报告目录、术语表与阅读顺序。
CC Auto Mode 01 - Entry Point 总览
权限模式体系、三层状态管理、入口矩阵与首次同意弹窗(auto mode 入口总览)。
CC Auto Mode 02 - 安全判定分类管道
两阶段分类器管道:快路径、白名单、Stage 1/2、transcript 构建与缓存策略。
CC Auto Mode - 03 - 权限剥离与信任边界
进入 auto 时的危险 allow 规则剥离、stash/restore 与敏感路径信任边界。
CC Auto Mode - 04 - 多 Agent 安全交接
多 Agent 场景下的 Outbound/Inbound 分类、子进程继承与 AFK header latch。
CC Auto Mode 05 - 门禁、熔断与异步踢出
同步/异步门禁、GrowthBook 熔断、kickout 变换与模型支持判定。
CC Auto Mode 06 - 配置体系与可定制 Slot
分类器 prompt 三 Slot(allow / soft_deny / environment)、设置合并与 CLI 子命令。
CC Auto Mode 07 - Deny-and-Continue 韧性设计
Deny-and-Continue:拒绝后的 tool_result 反馈、denial tracking 阈值与 fail-closed/open。
CC Auto Mode 附录 A - 单次请求的上下文整形流水线
附录 A:queryLoop 出站前 budget/snip/microcompact/collapse/autocompact 与 Harness 边界。
CC Auto Mode 附录 B - 长会话压缩与多线程状态隔离
附录 B:autoCompact、Session Memory、PTL、cached MC 隔离与 Teammate 沙箱。
CC Auto Mode 附录 C - 分类器边界之外的纵深防御
附录 C:subprocessEnv、输入净化、通道 safetyCheck、系统提示与纵深时间轴速查。
记一个愉快的周末
排练拉二钢协的临场震撼、扩列与重温《少女歌剧》、参与开源项目 star 破三万等喜事叠满的周末杂记。
Envisioning a Human Like AI:A Context-Centric Architecture
以动态上下文工程为核心的类人 Agent 随笔:记忆裁剪、人格、工具调用与「灵魂在文本中流动」。
2026.01.15
毕设课题与大厂论文「撞车」的复杂心情,以及造数据、筛特征与摸漏洞的断续实验笔记。
Advice From Anthropic
Anthropic 摘抄:基础研究背景如何转向 LLM 可解释性——代码能力、开源贡献与 MechInterp 学习路径。
Anti-Sycophancy Prompts
反谄媚提示:通过假装稿件出自他手等方式,诱导模型给出真正尖锐、建设性的批评。
Latent Memory 调研
隐空间推理(Latent Reasoning)的底层架构与多路径并发算法调研。
LLM Safety 资源
LLM 安全与对齐信息源指南:顶会、Anthropic/OpenAI/DeepMind/学界实验室与社区仓库索引。
文档
科研用链接合集:HuggingFace、ModelScope、TransformerLens、SAELens 与 pip 镜像等。
202511 Agentic Safety
Agent 强化学习与对齐:记忆架构、勒索案例、工具滥用与相关论文链接汇编。
后训练
PPO 核心思想:裁剪概率比限制策略更新步长,配合 GAE 优势与多轮 epoch 优化的速记推导。
强化学习
强化学习系统化笔记:MDP 记号、蒙特卡洛、TD、SARSA、Q 学习与 DQN 等算法脉络。
World Model Safety
世界模型概念导读与 CVPR 教程链接,附视频生成模型与 WM 评测基准汇编。
Interpretable Interpretability & LLM Safety
可解释性如何服务 LLM 安全:基础模型、微调、MechInterp 工具与对齐资料索引长文。
SAE 特征筛选
用正负样本在 SAE 特征上的平均激活差筛选与安全相关特征,并讨论方向性与统计检验。
Transformer
把自注意力写成集合上的动态加权聚合:QKV、缩放点积、多头与位置编码等推导长文。
2025.01.26 ?
简短随记。
2025.01.01 2025的第一天
2025的第一天 原来只有我在熬夜干活 真是天选牛马
2024.12.21 作为llm tcs双料特工,绝对是强利益
作为llm/tcs双料特工,绝对是强利益相关。2022自己选专业的时候就写过一篇博客。有空再更新一下续集吧
2024.10.08 大家好,我是学物理的
大家好,我是学物理的
2024.07.11 大型二次元同好会CVPR超越SCI成为第
大型二次元同好会CVPR超越SCI成为第二大学术出版物 p1谷歌学术出版物榜 p2CVPR2024会场
2024.06.30 单人刷榜第一
单人刷榜第一 非常好比赛,使我电脑百epoch消耗25ml水 榜一应该是官方或者挂逼
2024.06.07 如图
QQ 空间说说迁入:图片记录。
关于LLM的胡扯
面向非专业人士梳理 GPT、预训练与 Transformer 概念,讨论文本建模边界、数学能力与常见舆论误区。
2023.07.01 192G统一内存架构
192G统一内存架构 心动了 看看是不是忽悠导师整一点 或者哪位富哥送我一个
2023.06.14 一个晚上 一张显卡 一个奇迹
一个晚上 一张显卡 一个奇迹 你看连这个简介页都在嘲讽我
2023.03.10 期待
期待
2022.12.05 各位看好自己的饭碗
各位看好自己的饭碗 #ChatGPT
2022.10.24
在数学与计算机之间的身份摇摆、木然空虚与是否转向 AI 的长篇自省,夹杂社交渴望与自闭式舒适区。
2022.01.21 收获闲聊机器人一个
瞳孔地震.jpg
2021.12.18 tensorflow风评有点差哦
tensorflow风评有点差哦 正好我换了电脑,新电脑装了好久没装好 那我就跳槽搞pytorch了哦 google你好自为之 也就为了写个pvz脚本我容...
2020.04.05 达成成就
达成成就 一周入门机器学习 交作业啦 完结撒花[em]e400198[/em][em]e400198[/em][em]e400198[/em]
2020.04.03 Tensorflow整活完成
Tensorflow整活完成 打开任务表 怎么还有一个Kmeans?! 我的肝啊 不管了先做会儿学校的作业 肝硬化警告[em]e401095[/em]
2020.04.02 从零开始的整活
从零开始的整活...... 笔记就记这了 累死了 就是不知道能不能当作业交 这一篇是 https://www.luogu.com.cn/blog/Nash...
2020.03.31 tensorflow整半天甚都没整出来
tensorflow整半天甚都没整出来 我甚至想用C++来做这堆作业 但是 python真的太短啦 想起一句话:人生苦短 我用python
2020.03.28 科幻剧:从零开始一周写出机器学习
科幻剧:从零开始一周写出机器学习python代码 诶不对bgm好像不该放这个(图1)
2020 英才计划
2020.03.28 科幻剧:从零开始一周写出机器学习 2020.03.31 tensorflow整半天甚都没整出来 2020.04.02 从零开始的整活 2020.04.03 Tensorflow整活完成 2020.04.05 达成成就 2020.11.10 累死了(2000字,总个鬼结)