Meituan выпустила LongCat-2.0: первую LLM с триллионом параметров, обученную исключительно на китайских чипах

Meituan выпустила LongCat-2.0: первую LLM с триллионом параметров, обученную исключительно на китайских чипах

Прокомментировать Просмотры: 31

Китайский технологический гигант Meituan представил LongCat-2.0 — передовую языковую модель нового поколения, обладающую 1,6 трлн параметров и способную обрабатывать колоссальный контекст до 1 млн токенов. Принципиальной особенностью проекта стал полный цикл создания — от первоначального обучения до развертывания — на вычислительной инфраструктуре, состоящей из 50 тыс. отечественных специализированных чипов. Это достижение знаменует собой важную веху, подтверждая возможность подготовки моделей такого масштаба исключительно на национальных аппаратных решениях.

Под аббревиатурой ASIC (интегральные схемы специального назначения) здесь подразумеваются высокопроизводительные ускорители, спроектированные для нужд машинного обучения и превосходящие универсальные графические процессоры в узкоспециализированных задачах. Эксперты полагают, что аппаратная платформа базируется на разработках Huawei, опираясь на интеграцию с коммуникационной библиотекой HCCL (Huawei Collective Communication Library), хотя официальное подтверждение партнерства отсутствует.

Функционал LongCat-2.0 сфокусирован на агентных задачах: написании и отладке программного кода, интеграции с внешними API и выстраивании многоступенчатых логических цепочек. Обучающая выборка системы превышает 30 трлн токенов, включая массивы мультиязычных данных и специализированные программные репозитории.

Meituan выпустила LongCat-2.0: первую LLM с триллионом параметров, обученную исключительно на китайских чипах
Источник: Meituan

Фундаментом производительности модели стал алгоритм LongCat Sparse Attention (LSA). Этот механизм разреженного внимания динамически отбирает наиболее релевантные фрагменты контекста вместо полного попарного сканирования всех токенов. Такой подход позволяет масштабировать обработку до 1 млн токенов, практически нивелируя квадратичную вычислительную сложность и приближая ее к линейной.

Архитектура Mixture of Experts обеспечивает динамическую активацию параметров, задействуя от 33 до 56 млрд «весов» на один токен. Это позволяет экономить вычислительные мощности на простых запросах и подключать всю мощь системы для решения комплексных задач, оптимизируя общие затраты на инференс при сохранении высокой точности.

Отдельного внимания заслуживает технология MOPD (Multi-Teacher On-Policy Distill), где знания группы профильных экспертов переносятся в единую модель. В LongCat-2.0 это реализовано через триаду направлений: агентная работа (API и инструменты), логические рассуждения (STEM-дисциплины) и интерактивное взаимодействие (следование инструкциям и минимизация галлюцинаций).

Результаты тестирования показывают, что LongCat-2.0 уверенно конкурирует с лидерами индустрии. В бенчмарке SWE-bench Pro модель получила 59,5 балла, практически достигнув уровня GPT-5.5 и Claude Opus, опережая при этом Gemini 3.1 Pro. Аналогично высокие показатели зафиксированы в Terminal-Bench 2.1 и задачах веб-автоматизации.

Практические кейсы демонстрируют впечатляющие возможности: автоматическое развертывание SQL-агентов, глубокий рефакторинг масштабных кодовых баз под актуальные API, генерацию функциональных веб-приложений и создание 3D-сцен на Three.js по текстовому описанию.

Таким образом, LongCat-2.0 знаменует двойной технологический сдвиг: переход к моделям триллионного масштаба на локальном «железе» и перенос вектора развития в сторону интеллектуальных агентов, где ценность определяется не только качеством текста, но и эффективностью цепочек действий. Это не просто эксперимент, а серьезная заявка на лидерство, подчеркивающая возросшую автономность и конкурентоспособность китайской экосистемы ИИ-разработок.

 

Источник: iXBT

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов