HAN 的 attention 中为什么要加入 reduce_sum 和 reduce_max?

作者: fengdoudou1895创建于 2020年4月21日更新于 2020年5月20日

在HAN的attention里面看到: attetion_logits = tf.reduce_sum(hidden_state_context_similarity, axis=2) attention_logits_max = tf.reduce_max(attention_logits, axis=1, keep_dims=True) p_attention = tf.nn.softmax(attetion_logits-attention_logits_max) 原论文里没有看到这个操作,请问这是为什么?

内容来源: brightmart/text_classification