Colibrì proof-of-concept gains frontier-level 1.5-TB AI model — novel approach runs on only 25GB of RAM and shows promise for local AI setups
Colibrì запускает 1,5-ТБ AI-модель на 25 ГБ RAM: чудо есть, но ждать ответ придётся очень долго

Идея звучит почти как обман: взять огромную модель на 744 млрд параметров, которая в нормальном мире просит датацентр, и запустить её на обычной машине с 25 ГБ памяти. Colibrì показывает, что это возможно. Но есть нюанс — скорость.

Что произошло

Colibrì доказал возможность запуска, но не удобство работы. При 0,05–0,1 токена в секунду даже короткий ответ превращается в ожидание, поэтому 25 ГБ RAM здесь нельзя сравнивать с нормальным локальным AI-компьютером.

  • Итальянский инженер Vincenzo, известный как JustVugg, создал Colibrì для запуска GLM-5.2 объёмом около 1,5 ТБ.
  • Демонстрация использовала обычный CPU, 25 ГБ RAM и виртуальный NVMe-накопитель около 1 ГБ/с.
  • Скорость заявлена на уровне примерно 0,05–0,1 токена в секунду, то есть практический диалог пока невозможен.
  • Подход использует особенности MoE-моделей: нужные эксперты подгружаются кусками, а не вся модель сразу держится в быстрой памяти.

Почему это важно

Это не конкурент ChatGPT в браузере и не готовая замена GPU-серверу. Это инженерный трюк, который показывает: часть ограничений можно обходить, если согласиться на жестокую потерю скорости.

Для домашнего AI это всё равно важно. Сегодня локальные модели упираются в видеопамять и RAM, а Colibrì показывает направление: возможно, огромные модели можно запускать «лениво», таская нужные куски по требованию.

Но пока один запрос может занимать часы, речь идет скорее о proof-of-concept, чем о рабочем инструменте для пользователя.

Экономия памяти оплачена временем

Секрет не в чудесном сжатии 1,5 ТБ до 25 ГБ. Большая часть модели остаётся на накопителе, а в оперативную память подаются только нужные эксперты MoE. То есть система заменяет дефицит RAM постоянным обменом с NVMe.

Это красивый инженерный компромисс, но накопитель на 1 ГБ/с и процессор не могут имитировать сотни гигабайт в секунду, доступные ускорителю. Чем меньше память, тем чаще приходится ждать загрузку весов, и вся “фронтирная” модель работает в темпе печатной машинки с часовыми паузами.

Где такой подход всё же может пригодиться

Для интерактивного помощника — пока нигде. А вот для редких автономных задач, экспериментов с маршрутизацией экспертов или проверки совместимости огромной модели без аренды сервера идея уже полезна.

Если разработчики научатся заранее угадывать нужные блоки, кэшировать их и использовать более быстрые SSD, скорость может вырасти. Но новость не отменяет требования к памяти: она показывает, что модель можно запустить почти на чём угодно, если пользователь готов расплатиться производительностью.

Итог

Итог: Colibrì не делает датацентр ненужным, но ломает психологический барьер. Огромную модель можно запустить не только на стойке с GPU — просто за это придётся расплачиваться временем.