Yikang ShenGated Linear Attention Transformers with Hardware-Efficient TrainingAligning Large Multimodal Models with Factually Augmented RLHFImproving Reinforcement Learning from Human Feedback with Efficient Reward Model EnsembleParallelizing Linear Transformers with the Delta Rule over Sequence LengthAll names