科研12
科研索引
科研建议、经历记录与研究笔记的索引页。
2026.04.21 如图
QQ 空间说说迁入:图片记录。
2026.03.19 如图
#社会观察 #992 #投稿 学术界的劣币与良币
2026.01.15
毕设课题与大厂论文「撞车」的复杂心情,以及造数据、筛特征与摸漏洞的断续实验笔记。
Advice From Anthropic
Anthropic 摘抄:基础研究背景如何转向 LLM 可解释性——代码能力、开源贡献与 MechInterp 学习路径。
LLM Safety 资源
LLM 安全与对齐信息源指南:顶会、Anthropic/OpenAI/DeepMind/学界实验室与社区仓库索引。
文档
科研用链接合集:HuggingFace、ModelScope、TransformerLens、SAELens 与 pip 镜像等。
202511 Agentic Safety
Agent 强化学习与对齐:记忆架构、勒索案例、工具滥用与相关论文链接汇编。
World Model Safety
世界模型概念导读与 CVPR 教程链接,附视频生成模型与 WM 评测基准汇编。
Interpretable Interpretability & LLM Safety
可解释性如何服务 LLM 安全:基础模型、微调、MechInterp 工具与对齐资料索引长文。
SAE 特征筛选
用正负样本在 SAE 特征上的平均激活差筛选与安全相关特征,并讨论方向性与统计检验。
2022.09.30 直播看论文?
???