Как запустить ИИ-модель локально? Я провёл эксперимент: сравнил GPT-2 (2019) и Qwen3-0.6B (2025) на своём ноутбуке. Читайте, как преодолеть ошибки и получить реальные результаты.
Две недели назад я ни разу не запускал ИИ-модель на своём компьютере. Все мои проекты просто вызывали облачные API с ключом в коде. Но после того, как я увидел в лаборатории AMD Advancing AI 2026, как модель отвечает на вопрос прямо с ноутбука, ничего не отправляя в интернет, меня зацепило. У меня есть привычка: когда что-то зажигает, я бросаюсь в это, даже если не готов. Так было и на этот раз. Я выбрал проект, который был мне не по зубам, и целую неделю не отпускал его. Суть не в числах — хотя и в них тоже. Главное, что я натыкался на стены и продолжал идти. Дальше — просто рассказ как.
Идея была в «модельной археологии»: взять модель 2019 года и модель 2025 года, запустить их на одном ноутбуке и измерить, что изменилось за шесть лет. Я назвал это Second Squeeze. Выжать старый лимон, выжать новый — посмотреть, одинаковый ли сок. Старый лимон: GPT-2 XL, 2019 год, 1,5 миллиарда параметров. Новый лимон: Qwen3-0.6B, 2025 год, меньше половины размера. Обе запускались локально через Lemonade — локальный ИИ-сервер от AMD. Я никогда в жизни не устанавливал ничего подобного. Но начал.
Всё пошло негладко. Команда не совпадала с документацией. Путь к исполняемому файлу не был прописан. GPU-бэкенд пытался загрузиться и завис на заблокированном файле дважды. Мой Python оказался слишком новым для инструмента оценки, пришлось поднимать вторую версию Python специально для проекта. Ничего героического. Но разбираться было интересно! Каждая стена сводилась к одному и тому же маленькому решению: закрыть вкладку или прочитать ошибку и попробовать ещё раз. Я выбирал «ещё раз». В конце концов крошечная модель 2025 года поздоровалась со мной с моего собственного ноутбука, и я, кажется, издал радостный возглас.
Изначально я хотел измерить точность. У GPT-2 есть известный бенчмарк 2019 года, и я хотел проверить, подтверждаются ли старые результаты. Но для этого теста нужны вероятностные данные от модели, а Lemonade не отдавал их в нужном формате. Тупик. Старый я воспринял бы это как доказательство, что я не гожусь для таких задач. Но теперь я с помощью Claude прочитал документацию, выяснил, чего не хватает, воспроизвёл проблему чисто и зарегистрировал её в репозитории Lemonade, чтобы следующий человек наткнулся на указатель, а не на стену. Мой первый вклад в open source, рождённый из того, что что-то не работало. Затем я изменил вопрос: не «насколько умна», а «насколько быстра» и «способна ли следовать инструкции». Тот же интерес, другая дверь.
Это часть, которой я горжусь больше всего, и началась она с ошибки. Первый замер скорости показал у GPT-2 0,31 токена в секунду. По сравнению с 90 токенами у новой модели — разрыв в 297 раз. Огромный. Мне очень хотелось, чтобы это было правдой. Но перед публикацией Claude написал скрипт, чтобы любой мог перезапустить все замеры одной командой. Я запустил. GPT-2 выдал 8,5 токенов в секунду, а не 0,31. Первое число было мусором: замер сделан, пока бэкенд ещё скачивался, а модель была холодной с диска. Реальный разрыв — около 11 раз, а не 297. Я мог бы оставить 297x. Никто бы не проверил. Но я оставил 11x и записал, почему первое число врало. Потому что число, которое нельзя воспроизвести, — это не результат, а слух. Инструмент, который я создал для честности, поймал меня на обмане. Это было как весь месяц в одном моменте.
И быстро о возможностях, потому что это меня рассмешило: я попросил обе модели закончить фразу «Столица Франции —». Модель 2025 года ответила «Париж» и даже показала небольшие рассуждения перед ответом. Модель 2019 года, у которой нет понятия диалога, выдала стену случайных операторов импорта. Шесть лет — большой срок.
Вот что я взял из этой сборки, и это не токены в секунду. Каждый шаг был тем, чего я раньше не делал. Запустить модель локально. Прочитать стек-трейс с помощью Claude. Зарегистрировать issue в репозитории Lemonade. Публично признать, что мой собственный заголовок был неверен. Любой из этих шагов был хорошим местом, чтобы сдаться. И единственное, что превратило это в проект, а не в папку с незаконченными попытками, — это то, что я не сдался. Думаю, это навык, который мне нравится укреплять больше, чем любой фреймворк. Продолжать пробовать новое. Продолжать настаивать, когда оно сопротивляется. Менять дверь, если она заперта, но не уходить из здания.
Second Squeeze опубликован. Есть дашборд, репозиторий, тесты, которые можно попробовать сломать, и issue, которое я зарегистрировал и которое может помочь закрыть реальный пробел. В следующий раз я хочу запустить всё на настоящем AMD GPU и добавить ещё один столбец. Это будет новый рывок, новый день. Если вы давно кружите вокруг чего-то, что кажется вам не по зубам, пусть это будет вашим знаком. Начинайте, пока не готовы. Натыкайтесь на стены. Продолжайте.
Контекст: я пришёл в программирование из зала суда. От присяжного до создателя ИИ примерно за год, самоучка, учусь публично. Я направляю, модели генерируют, я проверяю и принимаю решения. Это линза, через которую я пишу.
Хочешь закрепить знания на практике?
Решай задачи на Algolit — интерактивная платформа для обучения
Начать бесплатно →