Kimi K2.6: Cerebras представила триллионную ИИ-модель, работающую быстрее GPU
Иллюстрация: Nano Banana
Спустя всего неделю после знакового IPO 2026 года, калифорнийская компания Cerebras Systems перешла в решительное наступление на рынке высокопроизводительного инференса. Разработчик анонсировал интеграцию Kimi K2.6 — передовой открытой модели с триллионом параметров от пекинской Moonshot AI — в свою корпоративную экосистему. Принципиальное отличие заключается в скорости: на мощностях Cerebras нейросеть выдает почти 1000 токенов в секунду, оставляя далеко позади любые решения на базе традиционных графических процессоров (GPU).
Независимая экспертиза, проведенная аналитиками Artificial Analysis, подтвердила выдающийся показатель в 981 токен в секунду. Это преимущество делает архитектуру Cerebras в 6,7 раза производительнее топовых облачных GPU-провайдеров и в 23 раза быстрее среднерыночных значений. Наглядный пример: типичная задача по написанию кода объемом 10 000 входных токенов (включая анализ промпта, логические выводы и генерацию ответа) выполняется системой Cerebras за 5,6 секунды, тогда как облачный сервис Kimi тратит на аналогичную операцию 163,7 секунды.
Этот успех стал стратегическим прорывом для Cerebras, разрушив устоявшийся стереотип о том, что их уникальные гигантские процессоры, занимающие всю кремниевую пластину, пригодны лишь для компактных моделей. Kimi K2.6 — первая в истории компании «триллионная» модель, внедренная в коммерческую эксплуатацию. Располагая капитализацией в $95 миллиардов и $5,55 миллиарда свободных средств, полученных в ходе IPO, Cerebras подтверждает свои амбиции стать ключевым игроком на технологическом олимпе.
Модель Kimi K2.6, представленная Moonshot AI в апреле, использует архитектуру Mixture-of-Experts (MoE), где из триллиона параметров в каждом рабочем цикле задействуются 32 миллиарда. Лидерство в рейтинге SWE-Bench Pro с результатом 58,6 баллов позволяет алгоритму на равных конкурировать с GPT-5.4 и Claude Opus 4.6. Для бизнеса эта открытая технология становится отличной альтернативой дорогостоящим закрытым API от OpenAI и Anthropic, которые к тому же страдают от нестабильной доступности вычислительных ресурсов.
Феноменальная скорость Cerebras объясняется инновационным подходом к аппаратному обеспечению. В отличие от стандартных кластеров на базе множества GPU, где сетевые задержки при передаче данных между чипами становятся «узким местом», процессор Cerebras Wafer-Scale Engine 3 представляет собой единую монолитную структуру. Наличие 44 гигабайт сверхбыстрой памяти SRAM непосредственно на кристалле обеспечивает пропускную способность, в 200 раз превышающую возможности интерфейса NVLink. В случае с Kimi K2.6 веса модели распределяются между 20 системами CS-3, но благодаря высокой интеграции эксперты каждого слоя MoE обрабатываются на аппаратной скорости памяти SRAM.
На данный момент Cerebras предлагает это решение исключительно корпоративному сегменту и компаниям из списка Fortune 500, ограничивая публичный доступ для оптимизации нагрузки. В плане ценообразования компания ориентируется на премиальный сегмент облачных провайдеров. Cerebras не стремится конкурировать в нише бюджетных медленных решений, предпочитая метафору «тяжелого тягача» в противовес «малолитражному транспорту».
Аналитики подчеркивают, что инференс стремительно вытесняет обучение моделей по коммерческой значимости, поскольку именно скорость работы ИИ-агентов становится фундаментом бизнес-эффективности. На этом фоне конкуренция обостряется: чего стоит недавнее поглощение Nvidia стартапа Groq за $20 миллиардов. Cerebras отвечает агрессивным циклом обновлений и стратегическим партнерством с OpenAI на сумму свыше $20 миллиардов для обеспечения работы их новейших моделей генерации кода.
Джеймс Ван, директор по продуктовому маркетингу Cerebras, отмечает, что запуск Kimi K2.6 — лишь начало амбициозной программы по адаптации сложнейших моделей к рекордным скоростям вычислений. Компания убеждена в грядущей трансформации мировой экономики под управлением автономных цифровых агентов. Победу одержит тот, чьи ИИ-системы будут выдавать комплексные программные решения быстрее, чем пользователь успеет закончить чашку кофе.
Источник: iXBT
Искусственный интеллект захватит рынок серверных процессоров, а Arm догонит Intel и AMD
AMD пыталась скрыть этот провал: тесты доказали крайнюю невыгодность Radeon RX 9050
Китайская YMTC сенсационно вошла в тройку лидеров рынка памяти NAND
Спустя 150 лет после «войны токов» Nvidia, Google и Microsoft возвращаются к постоянному току
Устаревшие чипы Nvidia A100 останутся в аренде у CoreWeave как минимум до 2029 года
Первая партия ноутбуков Asus с процессорами Nvidia RTX Spark полностью распродана партнёрами компании
Две RTX 5060 Ti с 8 ГБ почти помещаются в цену одной версии на 16 ГБ
Авторы Phantom Blade Zero назвали системные требования: игра на UE5 запустится даже с GTX 1660