生猛活海鲜大排档

Search posts…

AI52

202607 Agent Safety Benchmarks

202607 Agent Safety Benchmarks

Benchmarks / Evals / Audits Anthropic 【2025-03-13】【Anthropic】【官方研究博客】Auditing language models for hidden objectives:Anthropic 将 alignment audit 具体化为实验流程:故意训练带隐藏目标的模型,再让审计团队盲查;是后续 A...

AI 2026 Jul 01 20 min read
202607 Socioaffective Alignment

202607 Socioaffective Alignment

https://www.emergentmind.com/topics/human-ai-companionship The Siren Song of LLMs: How Users Perceive and Respond to Dark Patterns in Large Language Models https://iclr.cc/virtual/...

AI 2026 Jul 01 16 min read
Scaling Laws

Scaling Laws

Chinchilla Scaling Laws How to Scale Your Model

AI 2026 Jun 01 1 min read
浮点数

浮点数

浮点数标准(主要是 IEEE 754)的定义并非随意的工程拍脑袋,而是一场数学严谨性、硬件执行效率和数值稳定性之间的极限拉扯。 该标准的主要设计者 William Kahan(因此获得图灵奖)在制定标准时,核心目标是为了解决当时科学计算中跨平台结果不一致,以及数值计算极易由于溢出或舍入导致系统崩溃的问题。 这种将32位(以单精度 float 为例)划分为 1...

AI 2026 Jun 01 16 min read
2026.04.21 如图

2026.04.21 如图

QQ 空间说说迁入:图片记录。

AI 2026 Apr 21 1 min read
ccauto-00-index

CC Auto Mode - Auto Mode 安全架构分析报告系列

Auto Mode 安全架构系列总索引:架构图、报告目录、术语表与阅读顺序。

AI 2026 Mar 31 5 min read
ccauto-01-entrypoint

CC Auto Mode 01 - Entry Point 总览

权限模式体系、三层状态管理、入口矩阵与首次同意弹窗(auto mode 入口总览)。

AI 2026 Mar 31 6 min read
ccauto-02-classifier

CC Auto Mode 02 - 安全判定分类管道

两阶段分类器管道:快路径、白名单、Stage 1/2、transcript 构建与缓存策略。

AI 2026 Mar 31 31 min read
ccauto-03-permission-stripping

CC Auto Mode - 03 - 权限剥离与信任边界

进入 auto 时的危险 allow 规则剥离、stash/restore 与敏感路径信任边界。

AI 2026 Mar 31 5 min read
ccauto-04-multi-agent

CC Auto Mode - 04 - 多 Agent 安全交接

多 Agent 场景下的 Outbound/Inbound 分类、子进程继承与 AFK header latch。

AI 2026 Mar 31 10 min read
ccauto-05-gate-circuit-breaker

CC Auto Mode 05 - 门禁、熔断与异步踢出

同步/异步门禁、GrowthBook 熔断、kickout 变换与模型支持判定。

AI 2026 Mar 31 8 min read
ccauto-06-configuration

CC Auto Mode 06 - 配置体系与可定制 Slot

分类器 prompt 三 Slot(allow / soft_deny / environment)、设置合并与 CLI 子命令。

AI 2026 Mar 31 4 min read
ccauto-07-deny-and-resilience

CC Auto Mode 07 - Deny-and-Continue 韧性设计

Deny-and-Continue:拒绝后的 tool_result 反馈、denial tracking 阈值与 fail-closed/open。

AI 2026 Mar 31 7 min read
ccauto-A-单次请求的上下文整形流水线

CC Auto Mode 附录 A - 单次请求的上下文整形流水线

附录 A:queryLoop 出站前 budget/snip/microcompact/collapse/autocompact 与 Harness 边界。

AI 2026 Mar 31 15 min read
ccauto-B-长会话压缩与多线程状态隔离

CC Auto Mode 附录 B - 长会话压缩与多线程状态隔离

附录 B:autoCompact、Session Memory、PTL、cached MC 隔离与 Teammate 沙箱。

AI 2026 Mar 31 13 min read
ccauto-C-分类器边界之外的纵深防御

CC Auto Mode 附录 C - 分类器边界之外的纵深防御

附录 C:subprocessEnv、输入净化、通道 safetyCheck、系统提示与纵深时间轴速查。

AI 2026 Mar 31 13 min read
2026.03.08

记一个愉快的周末

排练拉二钢协的临场震撼、扩列与重温《少女歌剧》、参与开源项目 star 破三万等喜事叠满的周末杂记。

AI 2026 Mar 09 3 min read
Envisioning a Human Like AI

Envisioning a Human Like AI:A Context-Centric Architecture

以动态上下文工程为核心的类人 Agent 随笔:记忆裁剪、人格、工具调用与「灵魂在文本中流动」。

AI 2026 Mar 01 31 min read
2026.01.15

2026.01.15

毕设课题与大厂论文「撞车」的复杂心情,以及造数据、筛特征与摸漏洞的断续实验笔记。

AI 2026 Jan 15 1 min read
Advice From Anthropic

Advice From Anthropic

Anthropic 摘抄:基础研究背景如何转向 LLM 可解释性——代码能力、开源贡献与 MechInterp 学习路径。

AI 2026 Jan 01 1 min read
Anti-Sycophancy Prompts

Anti-Sycophancy Prompts

反谄媚提示:通过假装稿件出自他手等方式,诱导模型给出真正尖锐、建设性的批评。

AI 2026 Jan 01 1 min read
Latent Memory 调研

Latent Memory 调研

隐空间推理(Latent Reasoning)的底层架构与多路径并发算法调研。

AI 2026 Jan 01 68 min read
LLM Safety 资源

LLM Safety 资源

LLM 安全与对齐信息源指南:顶会、Anthropic/OpenAI/DeepMind/学界实验室与社区仓库索引。

AI 2025 Dec 01 4 min read
文档

文档

科研用链接合集:HuggingFace、ModelScope、TransformerLens、SAELens 与 pip 镜像等。

AI 2025 Dec 01 1 min read
202511 Agentic Safety

202511 Agentic Safety

Agent 强化学习与对齐:记忆架构、勒索案例、工具滥用与相关论文链接汇编。

AI 2025 Nov 01 1 min read
后训练

后训练

PPO 核心思想:裁剪概率比限制策略更新步长,配合 GAE 优势与多轮 epoch 优化的速记推导。

AI 2025 Nov 01 3 min read
强化学习

强化学习

强化学习系统化笔记:MDP 记号、蒙特卡洛、TD、SARSA、Q 学习与 DQN 等算法脉络。

AI 2025 Nov 01 20 min read
World Model Safety

World Model Safety

世界模型概念导读与 CVPR 教程链接,附视频生成模型与 WM 评测基准汇编。

AI 2025 Oct 01 2 min read
Interpretable Interpretability & LLM Safety

Interpretable Interpretability & LLM Safety

可解释性如何服务 LLM 安全:基础模型、微调、MechInterp 工具与对齐资料索引长文。

AI 2025 Sep 01 13 min read
SAE 特征筛选

SAE 特征筛选

用正负样本在 SAE 特征上的平均激活差筛选与安全相关特征,并讨论方向性与统计检验。

AI 2025 Aug 01 12 min read
Transformer

Transformer

把自注意力写成集合上的动态加权聚合:QKV、缩放点积、多头与位置编码等推导长文。

AI 2025 Jul 01 29 min read
2025.01.26 ?

2025.01.26 ?

简短随记。

AI 2025 Jan 26 1 min read
2025.01.01 2025的第一天

2025.01.01 2025的第一天

2025的第一天 原来只有我在熬夜干活 真是天选牛马

AI 2025 Jan 01 1 min read
2024.12.21 作为llm tcs双料特工,绝对是强利益

2024.12.21 作为llm tcs双料特工,绝对是强利益

作为llm/tcs双料特工,绝对是强利益相关。2022自己选专业的时候就写过一篇博客。有空再更新一下续集吧

AI 2024 Dec 21 2 min read
2024.10.08 大家好,我是学物理的

2024.10.08 大家好,我是学物理的

大家好,我是学物理的

AI 2024 Oct 08 1 min read
2024.07.11 大型二次元同好会CVPR超越SCI成为第

2024.07.11 大型二次元同好会CVPR超越SCI成为第

大型二次元同好会CVPR超越SCI成为第二大学术出版物 p1谷歌学术出版物榜 p2CVPR2024会场

AI 2024 Jul 11 1 min read
2024.06.30 单人刷榜第一

2024.06.30 单人刷榜第一

单人刷榜第一 非常好比赛,使我电脑百epoch消耗25ml水 榜一应该是官方或者挂逼

AI 2024 Jun 30 1 min read
2024.06.07 如图

2024.06.07 如图

QQ 空间说说迁入:图片记录。

AI 2024 Jun 07 1 min read
关于LLM的胡扯

关于LLM的胡扯

面向非专业人士梳理 GPT、预训练与 Transformer 概念,讨论文本建模边界、数学能力与常见舆论误区。

AI 2023 Jul 12 25 min read
2023.07.01 192G统一内存架构

2023.07.01 192G统一内存架构

192G统一内存架构 心动了 看看是不是忽悠导师整一点 或者哪位富哥送我一个

AI 2023 Jul 01 1 min read
2023.06.14 一个晚上 一张显卡 一个奇迹

2023.06.14 一个晚上 一张显卡 一个奇迹

一个晚上 一张显卡 一个奇迹 你看连这个简介页都在嘲讽我

AI 2023 Jun 14 1 min read
2023.03.10 期待

2023.03.10 期待

期待

AI 2023 Mar 10 1 min read
2022.12.05 各位看好自己的饭碗

2022.12.05 各位看好自己的饭碗

各位看好自己的饭碗 #ChatGPT

AI 2022 Dec 05 1 min read
2022.10.24

2022.10.24

在数学与计算机之间的身份摇摆、木然空虚与是否转向 AI 的长篇自省,夹杂社交渴望与自闭式舒适区。

AI 2022 Oct 24 3 min read
2022.01.21 收获闲聊机器人一个

2022.01.21 收获闲聊机器人一个

瞳孔地震.jpg

AI 2022 Jan 21 1 min read
2021.12.18 tensorflow风评有点差哦

2021.12.18 tensorflow风评有点差哦

tensorflow风评有点差哦 正好我换了电脑,新电脑装了好久没装好 那我就跳槽搞pytorch了哦 google你好自为之 也就为了写个pvz脚本我容...

AI 2021 Dec 18 1 min read
2020.04.05 达成成就

2020.04.05 达成成就

达成成就 一周入门机器学习 交作业啦 完结撒花[em]e400198[/em][em]e400198[/em][em]e400198[/em]

AI 2020 Apr 05 1 min read
2020.04.03 Tensorflow整活完成

2020.04.03 Tensorflow整活完成

Tensorflow整活完成 打开任务表 怎么还有一个Kmeans?! 我的肝啊 不管了先做会儿学校的作业 肝硬化警告[em]e401095[/em]

AI 2020 Apr 03 1 min read
2020.04.02 从零开始的整活

2020.04.02 从零开始的整活

从零开始的整活...... 笔记就记这了 累死了 就是不知道能不能当作业交 这一篇是 https://www.luogu.com.cn/blog/Nash...

AI 2020 Apr 02 1 min read
2020.03.31 tensorflow整半天甚都没整出来

2020.03.31 tensorflow整半天甚都没整出来

tensorflow整半天甚都没整出来 我甚至想用C++来做这堆作业 但是 python真的太短啦 想起一句话:人生苦短 我用python

AI 2020 Mar 31 1 min read
2020.03.28 科幻剧:从零开始一周写出机器学习

2020.03.28 科幻剧:从零开始一周写出机器学习

科幻剧:从零开始一周写出机器学习python代码 诶不对bgm好像不该放这个(图1)

AI 2020 Mar 28 1 min read
2020 英才计划

2020 英才计划

2020.03.28 科幻剧:从零开始一周写出机器学习 2020.03.31 tensorflow整半天甚都没整出来 2020.04.02 从零开始的整活 2020.04.03 Tensorflow整活完成 2020.04.05 达成成就 2020.11.10 累死了(2000字,总个鬼结)

AI 2020 Mar 28 1 min read
笔记 113 posts 碎碎念 435 posts 流水账 105 posts 散文 10 posts