“可解释性”指三个相同词而几乎没有其他词的研究方案。
人们想要将计算结果反向化成算法。
人们想知道代表所携带的信息是什么。
人们想要一个能满足实验室外人的解释 它们使用不同的方法,并且——重要的部分——它们会接受不同的东西作为证据. 3个方案,没有一个领域 机械解释 试图恢复算法。
它所追求的主张有其形式: 这组注意头和MLP神经元,用这种方式接线,计算这个功能,这里是确认它的干预.
输出单位为回路.
这个方案中的工作以小模型为主——两层只注意的变压器,GPT-2小而玩具网络,受过模块算术训练——因为对一个算法的主张必须彻底检查,这只有在模型很小时才可被取取取.
代表性分析提出了一个更弱、更能回答的问题:在这种激活中有哪些信息,是否使用了这种信息?
探险分类者,代表-相似度度度度度度度度度度度度度度度度度入此地.
输出不是算法而是地图——部分相声信息按第四层可线性回溯,情绪按第八层可线性回溯,这里是它所走的方向.
后热解说取出一个模型作为固定的并产生一个单一的预测,来说明驱使它的原因.
显著地图,地物归属,反事实解释和取而代之模型都在这个家族中.
其消费者往往完全在研究之外:临床医生、贷款申请人、监管机构。
其成功标准相应不同,监管者通过解释意味着什么,而研究人员意味着什么,两者之间的差距在于这一领域大多数混乱的根源。
第四行贯穿所有三个方面:培训动态、研究培训中何时出现能力以及培训中重量的变化。
格鲁克京和相变文学属于这里.
它不是一个单独的方案,而是一个不同的轴心——对检查站序列提出的同样的问题,而不是最后的模式。
每一个方案都算成成功的方案描述 机械化A路线,其描述预言干预的结果并不适合。
消除这个头和这个特定错误出现; 从不同的快件补补这个活化, 输出翻转的方向是故事说它应该。
预防干预就是酒吧 可解码和因果使用的财产。
单是可解码性就很弱了——一个足够强的分类器在噪音中发现结构.
成功是可解码性,加上对已查明方向的干预,从而以预测的方式改变行为。
任务后c 一种忠实的解释(它反映了模型所做的,通过去掉所突出的内容加以核实)和有用(有人用它作出更好的决定).
两种半体都单独测试,大多数已公布的方法只在第二个上测试过.
一种在损失发生之前移动的进展措施——根据预期能力出现的权重或活化量计算,而不是事后描述。
将它们分开的问题问及任何可解释性要求:什么结果表明这是错的?
三个节目的回答非常不同,答案告诉你你们在读哪个节目。
机械化的说法是被干预所伪造的.
如果说标题9.6将有关主题的信息移到最后位置,那么其产出的零化就应完全打破依赖该信息的行为,而不要涉及其他信息。
如果打破了一切,索赔要求过于具体;如果没有打破,头就没有必要了.
代理索赔是由控制伪造的。
如果探测器在高空探测时 读取了第六层的合成深度