RNN的复兴04:线性注意力并行计算DPLR
本文主要总结了注意力机制优化之DPLR并行计算的若干基本问题,和我自己的一些体会。无论是KDA论文,还是RWKV论文在论述并行算法时都是极度的不友好,符号过于丑陋。描述也是一略而过,看的是云里雾里。本文使用清晰的符号和下角标,尽可能优雅描述并行计算的每个部分,带你快速看懂像现代RNN的并行算法。
小白爱吃柠檬O(∩_∩)O