您能给我一些指导,告诉我如何将此适用到像 Llava 这样的系统吗?

作者: Yingshu-Li创建于 2024年9月28日更新于 2025年5月16日

你好, 我目前正在探索如何在 LLAVA 或其他多模态 大语言模型 上可视化热图,以了解模型在生成文本时的重点。我熟悉使用 Grad-CAM 进行单目标分类任务。但是,由于 LLAVA 生成完整的句子,我不确定如何获取单个词的热图。您能否提供一些指导或建议,告诉我如何解决这个问题?

内容来源: jacobgil/pytorch-grad-cam