Как разреженный ИИ на 17 млрд параметров обходит плотную модель на 70 млрд: анатомия Mixture-of-Experts (MoE)
Если вы случайно упустили момент, когда создатели языковых моделей соревновались в наращивании гигантских чисел в названиях, а открыв глаза, обнаружили всеобщий тренд на скромное количество активных параметров, эта публикация написана специально для вас. Сегодня мы разберем метаморфозу, превратившую все передовые open-source флагманы в MoE-системы, выясним, почему Qwen3.5 при своих 397 миллиардах параметров генерирует текст с...









