词元之母TOK.MOM - 平台充值汇率 1:1 即 1 人民币充值到账 1 美元,支持一个 Key 调用近 600+ 海内外模型,限时特价模型低至 1 折,欢迎上岸!
| 来源 | 可选 — 通过 hermes skills install official/mlops/saelens 安装 |
| 路径 | optional-skills/mlops/saelens |
| 版本 | 1.0.0 |
| 作者 | Orchestra Research |
| 许可证 | MIT |
| 依赖 | sae-lens>=6.0.0, transformer-lens>=2.0.0, torch>=2.0.0 |
| 平台 | linux, macos, windows |
| 标签 | Sparse Autoencoders, SAE, Mechanistic Interpretability, Feature Discovery, Superposition |
Input Activation → Encoder → Sparse Features → Decoder → Reconstructed Activation
(d_model) ↓ (d_sae >> d_model) ↓ (d_model)
sparsity reconstruction
penalty lossMSE(original, reconstructed) + L1_coefficient × L1(features)| Release | 模型 | 层 |
|---|---|---|
gpt2-small-res-jb | GPT-2 Small | 多个残差流 |
gemma-2b-res | Gemma 2B | 残差流 |
| HuggingFace 上的各类 SAE | 搜索标签 saelens | 各种 |
| 参数 | 典型值 | 效果 |
|---|---|---|
d_sae | 4–16× d_model | 特征更多,容量更大 |
l1_coefficient | 5e-5 到 1e-4 | 越高 = 越稀疏,精度越低 |
lr | 1e-4 到 1e-3 | 标准优化器学习率 |
l1_warm_up_steps | 500–2000 | 防止特征早期死亡 |
| 指标 | 目标值 | 含义 |
|---|---|---|
| L0 | 50–200 | 每个 token 的平均激活特征数 |
| CE Loss Score | 80–95% | 相对原始模型恢复的交叉熵 |
| Dead Features | <5% | 从不激活的特征比例 |
| Explained Variance | >90% | 重建质量 |
| 类 | 用途 |
|---|---|
SAE | 稀疏自编码器模型 |
LanguageModelSAERunnerConfig | 训练配置 |
SAETrainingRunner | 训练循环管理器 |
ActivationsStore | 激活收集与批处理 |
HookedSAETransformer | TransformerLens + SAE 集成 |
references/ 文件夹:| 文件 | 内容 |
|---|---|
| references/README.md | 概述与快速入门指南 |
| references/api.md | SAE、TrainingSAE、配置的完整 API 参考 |
| references/tutorials.md | 训练、分析、引导的分步教程 |
| 架构 | 描述 | 适用场景 |
|---|---|---|
| Standard | ReLU + L1 惩罚 | 通用 |
| Gated | 学习门控机制 | 更好的稀疏性控制 |
| TopK | 恰好 K 个激活特征 | 一致的稀疏性 |