AI探索指南 Anthropic 模型可解释团队的研究员录了一期播客#ai创造营# 介绍了模型的可解释性和模型安全的的关系,以及两者为何重要 其中可解释性的研究流程和一些我们常见的模型概念解释比较有意思 可解释工具链的核心目标是绘制一张从「输入提示 A」到「输出文本 B」的完整“思维流程图(flowchart)”。 研究流程主要分为五步: 数据采样:向模型投喂多样化提示(对话、代码、诗歌等),记录每一层激活。 特征分解:利用聚类、稀疏编码将上亿维激活压缩成可人类理解的「概念向量」。 概念标注:通过统计「何…