Бумага |
arXiv |
Обзор |
Результаты |
Цитирование
(а) Стандартные остатки с равномерным накоплением добавок. (b) Full AttnRes: каждый уровень обрабатывает все предыдущие выходные данные. (c) Block AttnRes: слои группируются в блоки, сокращая объем памяти с O(Ld) до O(Nd).
Это официальный репозиторий для Остатки внимания (AttnRes)быстрая замена стандартных остаточных соединений в Transformers, которая позволяет каждому слою выборочно агрегировать более ранние представления посредством выученного, зависящего от входных данных внимания по глубине.
Стандартные остаточные соединения аккумулируют все выходные данные слоя с фиксированными единичными весами. По мере роста глубины эта равномерная агрегация ослабляет вклад каждого слоя и приводит к неограниченному росту величин скрытых состояний — хорошо известная проблема PreNorm.
AttnRes заменяет это фиксированное накопление вниманием softmax над выходными данными предыдущего слоя:
где веса
Полный AttnRes прост, но требует памяти O(Ld) в масштабе. Блокировать AttnRes разделяет слои на N блоков, накапливает внутри каждого блока стандартные остатки и обращает внимание только на представления на уровне блоков. Имея ~8 блоков, он восстанавливает большую часть выигрыша Full AttnRes, выступая в качестве практической замены с минимальными накладными расходами.
Псевдокод в стиле PyTorch
AttnRes стабильно превосходит базовый уровень при всех вычислительных бюджетах. Блок AttnRes соответствует потере базовой линии, обученной с помощью В 1,25 раза больше вычислений.
| Категория | Контрольный показатель | Базовый уровень | AttnRes |
|---|---|---|---|
| Общий | ММЛУ | 73,5 | 74,6 |
| GPQA-Алмаз | 36,9 | 44,4 | |
| BBH | 76,3 | 78,0 | |
| TriviaQA | 69,9 | 71,8 | |
| Математика и код | Математика | 53,5 | 57,1 |
| HumanEval | 59,1 | 62,2 | |
| МБПП | 72,0 | 73,9 | |
| китайский | КММЛУ | 82,0 | 82,9 |
| C-Eval | 79,6 | 82,5 |
AttnRes улучшается по всем направлениям, причем наибольший прирост достигается в многоэтапном рассуждении (+7,5 на GPQA-Diamond) и генерации кода (+3,1 на HumanEval).
AttnRes смягчает разбавление PreNorm: выходные величины остаются ограниченными по глубине, а нормы градиента распределяются более равномерно по слоям.
Если наша работа оказалась для вас полезной, дайте ссылку
@misc{chen2026attnres,
title = {Attention Residuals},
author = {Kimi Team and Chen, Guangyu and Zhang, Yu and Su, Jianlin and Xu, Weixin and Pan, Siyuan and Wang, Yaoyu and Wang, Yucheng and Chen, Guanduo and Yin, Bohong and Chen, Yutian and Yan, Junjie and Wei, Ming and Zhang, Y. and Meng, Fanqing and Hong, Chao and Xie, Xiaotong and Liu, Shaowei and Lu, Enzhe and Tai, Yunpeng and Chen, Yanru and Men, Xin and Guo, Haiqing and Charles, Y. and Lu, Haoyu and Sui, Lin and Zhu, Jinguo and Zhou, Zaida and He, Weiran and Huang, Weixiao and Xu, Xinran and Wang, Yuzhi and Lai, Guokun and Du, Yulun and Wu, Yuxin and Yang, Zhilin and Zhou, Xinyu},
year = {2026},
archiveprefix = {arXiv},
eprint = {2603.15031},
primaryclass = {cs.CL}
}
2026-03-20 18:23:00
1774033591
#GitHub #MoonshotAIAttentionResiduals #GitHub
Читайте также




