您能否提供图 2 中用于可视化注意力的代码,或者帮助我们确定我们的方法是否存在问题?
作者: yuhkalhic创建于 2024年12月11日更新于 2025年3月8日
感谢您的出色工作。我们对您论文中图 2 中的注意力可视化有个问题。我们尝试使用以下方法重现可视化: - 取最后一个 Transformer 层 - 对所有注意力头进行求和 我们的方法示例如下。然而,我们的结果与您的结果大不相同。即使我将我的代码设置为第一个 Transformer 层的第一个头,我也无法获得与您一样高的分数和如此显著的分布模式。 您能否帮助我们理解,我们可能在哪些特定的预处理或归一化步骤中出现了漏洞? 为了更好地理解和重现您的结果,是否可以分享您使用的可视化代码?这对我们的研究将会非常有帮助。 感谢您抽出时间并提供帮助。 <img width="665" alt="屏幕截图 2024-12-11 145016" src="https://GitHub.com/user-attachments/assets/b09ada49-8039-48f1-8f43-12e56d7624e2">
内容来源: mit-han-lab/streaming-llm