生猛活海鲜大排档

Search posts…

科研12

科研索引

科研索引

科研建议、经历记录与研究笔记的索引页。

科研 2026 Jun 18 1 min read
2026.04.21 如图

2026.04.21 如图

QQ 空间说说迁入:图片记录。

AI 2026 Apr 21 1 min read
2026.03.19 如图

2026.03.19 如图

#社会观察 #992 #投稿 学术界的劣币与良币

科研 2026 Mar 19 1 min read
2026.01.15

2026.01.15

毕设课题与大厂论文「撞车」的复杂心情,以及造数据、筛特征与摸漏洞的断续实验笔记。

AI 2026 Jan 15 1 min read
Advice From Anthropic

Advice From Anthropic

Anthropic 摘抄:基础研究背景如何转向 LLM 可解释性——代码能力、开源贡献与 MechInterp 学习路径。

AI 2026 Jan 01 1 min read
LLM Safety 资源

LLM Safety 资源

LLM 安全与对齐信息源指南:顶会、Anthropic/OpenAI/DeepMind/学界实验室与社区仓库索引。

AI 2025 Dec 01 4 min read
文档

文档

科研用链接合集:HuggingFace、ModelScope、TransformerLens、SAELens 与 pip 镜像等。

AI 2025 Dec 01 1 min read
202511 Agentic Safety

202511 Agentic Safety

Agent 强化学习与对齐:记忆架构、勒索案例、工具滥用与相关论文链接汇编。

AI 2025 Nov 01 1 min read
World Model Safety

World Model Safety

世界模型概念导读与 CVPR 教程链接,附视频生成模型与 WM 评测基准汇编。

AI 2025 Oct 01 2 min read
Interpretable Interpretability & LLM Safety

Interpretable Interpretability & LLM Safety

可解释性如何服务 LLM 安全:基础模型、微调、MechInterp 工具与对齐资料索引长文。

AI 2025 Sep 01 13 min read
SAE 特征筛选

SAE 特征筛选

用正负样本在 SAE 特征上的平均激活差筛选与安全相关特征,并讨论方向性与统计检验。

AI 2025 Aug 01 12 min read
2022.09.30 直播看论文?

2022.09.30 直播看论文?

???

科研 2022 Sep 30 1 min read
笔记 113 posts 碎碎念 435 posts 流水账 105 posts 散文 10 posts