AetherFloat: новая архитектура 8- и 16-битных вычислений повысит скорость и энергоэффективность ИИ-процессоров
Стремительная эволюция систем искусственного интеллекта все чаще сталкивается с физическими лимитами аппаратного обеспечения. Нейропроцессоры (NPU) выполняют запредельное количество операций с плавающей запятой, однако классический стандарт IEEE 754, созданный десятилетия назад, не вполне оптимален для ИИ-вычислений из-за громоздкой логики и высокого энергопотребления. В масштабах современных дата-центров даже мизерная оптимизация каждой операции конвертируется в колоссальную экономию ресурсов всего кластера.
Особенно остро дефицит эффективности проявляется при переходе к низкобитным форматам, таким как 8-битный FP8 или OCP MX. Чтобы избежать потерь точности и переполнений, в них зачастую используется механизм блокового масштабирования (AMAX). Это усложняет архитектуру чипа и порождает дополнительные задержки, так как процессору приходится непрерывно отслеживать пиковые значения в потоках данных и пересчитывать коэффициенты.
Исследователь Кэйта Морисаки (Keita Morisaki) представил инновационную альтернативу — семейство числовых форматов AetherFloat, спроектированных специально под нужды ИИ-ускорителей. В основе решения лежит использование четырехзначной шкалы экспоненты (Base-4) и явной мантиссы. Такой подход позволил отказаться от «скрытого бита» и ресурсоемких процедур нормализации, характерных для традиционных вычислений с плавающей запятой.
Согласно проектным расчетам, внедрение AetherFloat радикально упрощает вычислительные узлы. Площадь блоков умножения-сложения (MAC) сокращается примерно на 33%, потребление энергии падает на 22%, а задержка критического пути уменьшается на 12% относительно стандартных реализаций FP8. Учитывая, что MAC-блоки являются фундаментом нейросетевых вычислений, подобные улучшения способны кратно повысить общую эффективность ускорителя.
Иллюстрация: Grok
Формат AetherFloat-8 (AF8) ориентирован прежде всего на инференс нейросетей и обладает внушительным динамическим диапазоном — примерно от 1,2×10⁻⁴ до 57 344. Это позволяет корректно обрабатывать аномальные значения (выбросы) в активациях больших языковых моделей без дополнительного аппаратного масштабирования. Как следствие, потребность в громоздких механизмах типа AMAX полностью отпадает.
Стоит отметить, что для достижения максимальной точности AF8 предполагает использование квантования с учетом обучения (QAT) — метода, при котором модель адаптируется к низкобитной разрядности еще на этапе тренировки.
Второй представитель семейства, AetherFloat-16 (AF16), позиционируется как эффективная замена популярному bfloat16. Эксперименты подтвердили, что AF16 обеспечивает сопоставимую точность вычислений, требуя при этом значительно меньше аппаратных ресурсов.
Оригинальной чертой обоих форматов стала схема кодирования Lexicographic One’s Complement. Она дает возможность сравнивать числа как обычные целые значения без предварительных преобразований. Это упрощает и ускоряет выполнение таких операций, как функция активации ReLU или MaxPooling, за счет использования более быстрых логических схем сравнения.
Работоспособность новой архитектуры была проверена на задачах обучения и исполнения LLM Qwen2.5-7B. Тесты показали, что AF8 демонстрирует стабильную сходимость при использовании QAT и оказывается более устойчивым к потере градиентов, чем стандартные форматы FP8. В свою очередь, точность AF16 практически не уступает показателям эталонного bfloat16.
Автор опубликовал исходный код архитектуры в открытом доступе для верификации и дальнейших исследований. Тем не менее, Морисаки подчеркивает, что для финальных выводов необходимы испытания на реальных кремниевых кристаллах и расширение тестов на другие типы нейросетевых моделей.
Если потенциал AetherFloat подтвердится на практике, эти форматы могут лечь в основу будущих поколений ИИ-процессоров. Переход на подобную математическую базу позволит создавать более дешевые и энергоэффективные ускорители, сохраняя прецизионную точность вычислений даже в условиях жесткой минимизации разрядности данных.
Источник: iXBT
Сравнение Samsung Galaxy S26 Ultra и iQOO 16 с лучшим дисплеем от Samsung
Как кремний взломал кремний: история создания первого в мире подтвержденного PCIe Gen2 x16 для CMP90HX
За полгода SpaceX совершила более 200 тысяч маневров уклонения для спутников Starlink
Sonnet выпустила док-станцию Breakaway Box 850 T5 для видеокарт с Thunderbolt 5 и блок питания на 850 Вт
Ученые призвали искать следы инопланетных технологий на Луне
Раскрыты детали Realme 16 Pro Harry Potter Edition: в комплекте будет письмо из Хогвартс и билет на поезд
Память DDR5 показала рекордный рост цен с начала года
Исторический запуск Starship: 22 сентября корабль впервые выйдет на орбиту и совершит шесть витков вокруг Земли