ГлавнаяБлогЗапуск ИИ-модели на своём ноутбуке: история одного эксперимента
Python

Запуск ИИ-модели на своём ноутбуке: история одного эксперимента

Как запустить ИИ-модель локально? Я провёл эксперимент: сравнил GPT-2 (2019) и Qwen3-0.6B (2025) на своём ноутбуке. Читайте, как преодолеть ошибки и получить реальные результаты.

Al
Редакция Algolitalgolit.ru
8 мин чтения27 июля 2026 г.

Две недели назад я ни разу не запускал ИИ-модель на своём компьютере. Все мои проекты просто вызывали облачные API с ключом в коде. Но после того, как я увидел в лаборатории AMD Advancing AI 2026, как модель отвечает на вопрос прямо с ноутбука, ничего не отправляя в интернет, меня зацепило. У меня есть привычка: когда что-то зажигает, я бросаюсь в это, даже если не готов. Так было и на этот раз. Я выбрал проект, который был мне не по зубам, и целую неделю не отпускал его. Суть не в числах — хотя и в них тоже. Главное, что я натыкался на стены и продолжал идти. Дальше — просто рассказ как.

Эксперимент: сравнение ИИ-моделей 2019 и 2025 годов

Идея была в «модельной археологии»: взять модель 2019 года и модель 2025 года, запустить их на одном ноутбуке и измерить, что изменилось за шесть лет. Я назвал это Second Squeeze. Выжать старый лимон, выжать новый — посмотреть, одинаковый ли сок. Старый лимон: GPT-2 XL, 2019 год, 1,5 миллиарда параметров. Новый лимон: Qwen3-0.6B, 2025 год, меньше половины размера. Обе запускались локально через Lemonade — локальный ИИ-сервер от AMD. Я никогда в жизни не устанавливал ничего подобного. Но начал.

Установка и первые трудности

Всё пошло негладко. Команда не совпадала с документацией. Путь к исполняемому файлу не был прописан. GPU-бэкенд пытался загрузиться и завис на заблокированном файле дважды. Мой Python оказался слишком новым для инструмента оценки, пришлось поднимать вторую версию Python специально для проекта. Ничего героического. Но разбираться было интересно! Каждая стена сводилась к одному и тому же маленькому решению: закрыть вкладку или прочитать ошибку и попробовать ещё раз. Я выбирал «ещё раз». В конце концов крошечная модель 2025 года поздоровалась со мной с моего собственного ноутбука, и я, кажется, издал радостный возглас.

Первый план провалился — я изменил подход

Изначально я хотел измерить точность. У GPT-2 есть известный бенчмарк 2019 года, и я хотел проверить, подтверждаются ли старые результаты. Но для этого теста нужны вероятностные данные от модели, а Lemonade не отдавал их в нужном формате. Тупик. Старый я воспринял бы это как доказательство, что я не гожусь для таких задач. Но теперь я с помощью Claude прочитал документацию, выяснил, чего не хватает, воспроизвёл проблему чисто и зарегистрировал её в репозитории Lemonade, чтобы следующий человек наткнулся на указатель, а не на стену. Мой первый вклад в open source, рождённый из того, что что-то не работало. Затем я изменил вопрос: не «насколько умна», а «насколько быстра» и «способна ли следовать инструкции». Тот же интерес, другая дверь.

Собственный бенчмарк поймал меня на ошибке

Это часть, которой я горжусь больше всего, и началась она с ошибки. Первый замер скорости показал у GPT-2 0,31 токена в секунду. По сравнению с 90 токенами у новой модели — разрыв в 297 раз. Огромный. Мне очень хотелось, чтобы это было правдой. Но перед публикацией Claude написал скрипт, чтобы любой мог перезапустить все замеры одной командой. Я запустил. GPT-2 выдал 8,5 токенов в секунду, а не 0,31. Первое число было мусором: замер сделан, пока бэкенд ещё скачивался, а модель была холодной с диска. Реальный разрыв — около 11 раз, а не 297. Я мог бы оставить 297x. Никто бы не проверил. Но я оставил 11x и записал, почему первое число врало. Потому что число, которое нельзя воспроизвести, — это не результат, а слух. Инструмент, который я создал для честности, поймал меня на обмане. Это было как весь месяц в одном моменте.

Сравнение возможностей: что ответили модели

И быстро о возможностях, потому что это меня рассмешило: я попросил обе модели закончить фразу «Столица Франции —». Модель 2025 года ответила «Париж» и даже показала небольшие рассуждения перед ответом. Модель 2019 года, у которой нет понятия диалога, выдала стену случайных операторов импорта. Шесть лет — большой срок.

Что я вынес из эксперимента

Вот что я взял из этой сборки, и это не токены в секунду. Каждый шаг был тем, чего я раньше не делал. Запустить модель локально. Прочитать стек-трейс с помощью Claude. Зарегистрировать issue в репозитории Lemonade. Публично признать, что мой собственный заголовок был неверен. Любой из этих шагов был хорошим местом, чтобы сдаться. И единственное, что превратило это в проект, а не в папку с незаконченными попытками, — это то, что я не сдался. Думаю, это навык, который мне нравится укреплять больше, чем любой фреймворк. Продолжать пробовать новое. Продолжать настаивать, когда оно сопротивляется. Менять дверь, если она заперта, но не уходить из здания.

Практический вывод: что делать прямо сейчас

Second Squeeze опубликован. Есть дашборд, репозиторий, тесты, которые можно попробовать сломать, и issue, которое я зарегистрировал и которое может помочь закрыть реальный пробел. В следующий раз я хочу запустить всё на настоящем AMD GPU и добавить ещё один столбец. Это будет новый рывок, новый день. Если вы давно кружите вокруг чего-то, что кажется вам не по зубам, пусть это будет вашим знаком. Начинайте, пока не готовы. Натыкайтесь на стены. Продолжайте.

Ссылки

Контекст: я пришёл в программирование из зала суда. От присяжного до создателя ИИ примерно за год, самоучка, учусь публично. Я направляю, модели генерируют, я проверяю и принимаю решения. Это линза, через которую я пишу.

#искусственный интеллект#локальный запуск#GPT-2#Qwen#Python
Al
Редакция Algolit

Пишем про алгоритмы, подготовку к собеседованиям и карьеру в IT — так, чтобы было понятно и полезно.

Хочешь закрепить знания на практике?

Решай задачи на Algolit — интерактивная платформа для обучения

Начать бесплатно →