Маленькие модели, большая независимость: Иван Ямщиков о том, почему SLM интереснее LLM как инженерная задача

public

Автор: Иван Ямщиков · Podlodka Podcast


Иван Ямщиков работает в Pleias — компании, которая строит открытые языковые модели. Во время записи выпуска Podlodka #468 вышла новость о партнёрстве Pleias с Nvidia в рамках проекта Nemotron. Это не случайный контекст: Ямщиков находится внутри процесса, а не смотрит на него снаружи.

Центральный вопрос выпуска — не технический, а стратегический: что произойдёт, если весь рынок AI окончательно сконцентрируется вокруг нескольких закрытых облачных провайдеров? Ямщиков формулирует это как инженерную проблему: зависимость от GPT-4 API — это зависимость от одного вендора с непрозрачной политикой изменений, ценообразования и доступа к данным. Маленькие открытые модели — это не «дешёвая альтернатива большим», это инструмент сохранения контроля над инфраструктурой. Модель на 7 миллиардов параметров, которая умещается на одной GPU и работает локально, даёт то, что никакое API не даёт: полную воспроизводимость, отсутствие утечки данных и независимость от апстрима.

Кому смотреть: разработчикам и архитекторам, которые принимают решение о том, какой LLM использовать в продукте — и хотят понять, когда открытая маленькая модель является правильным выбором, а не просто компромиссом.

Из этого можно взять в работу: если вы сейчас используете закрытый API для задачи, которая не требует GPT-4-уровня рассуждений (классификация, извлечение структуры, генерация по шаблону) — попробуйте запустить Mistral 7B или Phi-3 локально на той же задаче. Разрыв в качестве окажется меньше, чем вы ожидаете.


Ямщиков разбирает, что реально отличает маленькие модели от больших — не только размер, но и характер обучения. Большие модели обучаются на всём подряд, что даёт широту, но не глубину в конкретных доменах. Маленькие модели часто обучаются с фокусом: на коде, на научных текстах, на конкретном языке. Это означает, что для узкой задачи специализированная модель на 7B параметров может превзойти общую модель на 70B.

Данные важнее размера. Phi-3 от Microsoft — пример модели, которая при относительно небольшом размере показывает результаты, сопоставимые с моделями вчетверо больше, благодаря качественным синтетическим данным обучения. Ямщиков называет это «data-centric AI» в противовес «model-centric»: вместо увеличения числа параметров — тщательный отбор и синтез данных.

Pleias специализируется на европейских языках и открытых данных. Проект Common Corpus — крупнейший открытый мультиязычный датасет, на котором обучаются модели Pleias. Это прямой ответ на проблему: большинство доступных языковых данных — англоязычные, что делает модели значительно слабее для других языков. Открытый европейский датасет — инфраструктурный проект для независимости AI-экосистемы.

Локальный инференс на практике: llama.cpp позволяет запускать квантизованные модели на CPU без GPU. Ollama делает это ещё проще — одна команда, и модель работает локально как API. Ямщиков говорит о том, как это меняет архитектуру продуктов: когда инференс стоит не $0.01/запрос, а ноль, экономика use case меняется радикально.