Пробовал запускать локально в прошлом ноябре, но больше поиграться - [вот пост об этом](https://t.me/andreyposnov/3498)
Если не для программирования/вайбкодинга, то сетап очень прост: LMStudio, где легко скачать Gemma 4 12B или GPT-OSS - влезет на компьютеры с видеопамятью от 16гб. Хватит чтобы подстраховаться на случай отключения сервисов.
Но мне стало интересно, насколько локальные модели готовы к настоящей работе.
Пользуюсь Claude для пет проектов и на работе, но лимиты становятся все жеще. Все больше нужно создавать скиллы, агенты и обвязки чтобы не сжечь лимит. И иногда это все равно не спасает, а по вайбкодить желание есть)
⭐Сетап 1 - отклонен
[VSCode](https://t.me/andreyposnov/1352) + Cline + [Ollama](https://ollama.com/) с Qwen моделями
я настолько привык к Claude Desktop, что в Cline уже не удобно. Как откатится на год назад.
⭐⭐Сетап 2 - тестирую
[Hermes Desktop](https://hermes-agent.nousresearch.com/) - очень похож на Claude десктоп, но без привязки к Anthropic.
Хороший UI, сессии/папочки, скиллы и MCP, а локальные LLM можно выбрать и скачать прямо через UI. Изначально появился как CLI для агентов типа openclaw.
⭐⭐⭐Сетап 3 - тестирую (пока лидирует)
[Unsloth](https://unsloth.ai/) (десктоп приложение).
Увидел это репо в hermes и пошел изучить - оказалось это известный в сообществе открытого ИИ стартап, оптимизируют модели и фиксят баги в них.
Тула оказалась круче того же Claude Desktop. Тут тоже есть Model Hub, который показывает что доступно под твое железо, еще можно тренить! модели и работать с видео/картинками.
Показывает скорость генерации в токен/сек (в других местах надо кастомить) и всю нагрузку системы. Короче Claude Desktop отвязанный от Антропик, со всеми тулами (скиллы, мцп), RAG и огромном кол вом моделей на выбор. Плюс генерация и транскрибация аудио.
—
Тесты на landing page: index.html, css, js (результат в комментариях). В "голом" вызове в Cline VSCode:
qwen3-coder ~35 с ускорениями до 55 токенов в секунду 5-7мин
qwen3.8:27b-mlx ~14 токенов в секунду 60-90 минут
А в unsloth они повели себя по другому.
Claude Code, Codex и теперь Unsloth - это не просто окно взаимодействия с моделями, а так называемый Harness с инструментами, который позволяет оптимально выполнять задачу.
В итоге лендинг был сделан менее чем 20 минут на qwen3.8:27b. Генерация не ускорилась, это ограничено железом, но ускорилось выполнение задачи путем уменьшения итераций и вызова правильных инструментов.
—
Сделал по 4 прогона, результат отличный. qwen3.8 создает более креативные варианты, а Qwen3-Coder 30B A3B Instruct оказался крепким мидлом-исполнителем. Первую можно на планирование, вторую на исполнение - так и начну, пока Claude лимиты ресетятся.
Не Astra/Fable конечно, но с конкретным планом, инструкциями и скиллами - выполняет свои задачи. Особенно если план и инструменты подготовлены самим Fable/Astra 🙂
Как понять что локально будет норм работать?
Мой макбук купленный в декабре 2021: Macbook Pro 16, M1 Max (10/32), 64GB, 2TB.
Спасибо мне 5 лет назад, что не сэкономил на памяти. В Макбуках нового поколения ОЗУ и Видеопамять объединена, можно засунуть модель по жирнее, но есть ограничении в 400 ГБ/с в отличие от видеокарт.
Сайт где можно указать свой Мак или видеокарту и понять что потянет https://willitrunai.com/my-gpu
У unsloth столько квантований, что даже под небольшую память найдется уменьшенная - хуже по качеству, но рабочая. Даже Qwen3.8-27B есть 7ГБ, то есть пойдет на 16ГБ памяти
—
Минусы:
шумновато (кулеры на полную), не повайбкодить на природе) комп должен быть всегда в сети ибо батарейка убивается, и дольше - после облачных моделей заметно, но если не спешишь то нормально.
Плюсы:
лимиты больше не волнуют, раньше резеты приходилось ждать а теперь можно non-stop генерить код, текст, фото, видео, аудио )) и все бесплатно (если железо позволяет - у меня например видео слишком долго ждать, а изображения и аудио норм)
Планирую использовать даже на работе, хоть у рабочий ноут 24gb, но квантованная модель вполне сходит в жиру по таскам и в ноушен чтобы собрать нужную информацию не залезая в лимиты Claude/Codex 🙂 Не всегда и не для всего подойдет, но под мои задачи подойдет)
#ai
📸 Изображения