Skip to content

Latest commit

 

History

History
52 lines (30 loc) · 6.72 KB

File metadata and controls

52 lines (30 loc) · 6.72 KB

LocalForgeLLM

English · Русский · 简体中文 · Español

September 18 update (English): Bonsai benchmarks · REAP / APEX rebuild · Jev API + browser-use · Updated graphics.

Большие модели на железе, которое у вас уже есть. LocalForgeLLM — фреймворк, с которым ваш кодинг-агент собирает и оптимизирует локальный AI-стек. Укажите задачу и, при желании, MoE-модель; агент подбирает модель, движок, квантование и параметры запуска под ваше оборудование. Готовый стек можно использовать для локального чата, зрения и кодинг-агентов.

Стек: AI-агенты · документация моделей и движков · Python / Bash · движки инференса, например llama.cpp · бэкенды CPU / GPU · локальный HTTP API.

Установка

Что нужно: кодинг-агент с доступом к терминалу и место для выбранной модели. Зависимости и настройки памяти агент подбирает под ваш компьютер.

  1. Откройте этот репозиторий в своём кодинг-агенте и попросите прочитать AGENTS.md и SKILL.md.
  2. Опишите задачу, нужный размер контекста и бюджет RAM/VRAM. Укажите модель или доверьте её выбор агенту.
  3. Попросите агента по документации фреймворка установить движок, настроить модель и сохранить рабочий профиль запуска.

Для конкретного примера начните с наших профилей запуска Qwen и Gemma.

Как это работает

Агент изучает ваше железо и документацию моделей, подбирает модель, совместимый движок и формат весов, затем настраивает распределение CPU/GPU, контекст, кеш и батчи. Запускает вашу задачу, замеряет скорость и память, корректирует настройки и сохраняет лучший рабочий профиль. Этот цикл подходит для разных семейств MoE и методов квантования.

На основе задачи и железа агент выбирает движок, настраивает модель, измеряет результат и уточняет параметры, сохраняя готовый профиль локального запуска.

Примеры на RTX 4060

Ryzen 5 5600 · 32 ГБ RAM · 8 ГБ VRAM · контекст 32K · 10 сентября 2026 года. В этих двух профилях используются APEX GGUF + llama.cpp / Vulkan.

Модель / профиль Генерация RAM VRAM модели
Qwen3.6 35B-A3B · I-Compact 21.11 токена/с пик RSS 13.43 ГиБ 4.07 ГиБ
Gemma 4 26B-A4B Heretic · I-Balanced + зрение 9.78 токена/с лимит службы 11 ГиБ снимок 4.88 ГиБ

Qwen: 28 запросов, до 29,087 токенов контекста. Gemma: один запрос с подключённым зрением. Указана скорость генерации токенов.

Сравнение Qwen3.6: LocalForgeLLM — 21.11, Colibri — 9.9, FreeToken — 39.3 токена/с. Наш пик RSS — 13.43 ГиБ; у Colibri заявлено 40 GB; у FreeToken указано 32 ГиБ установленной RAM. Условия тестов различаются.

Наша скорость Qwen — 2.13× от заявленной прогретой скорости Colibri и на 46.3% ниже заявленной скорости FreeToken на показанных выше конфигурациях. Модель на 35B параметров работает здесь с пиком RSS 13.43 ГиБ и VRAM модели 4.07 ГиБ. Настройки, определения показателей и источники →

Gemma 4 с MTP

Обновление от 11 сентября: 14,83 токена/с в среднем по двум запросам; длинный ответ — 1535 выходных токенов за 102,05 с генерации, 15,03 токена/с. Основная модель остаётся Heretic APEX I-Balanced; Q8_0 — отдельная MTP-голова. Распределение основных весов и окно 32K сохранены.

Разница с предшествующим запросом без MTP (9,81 токена/с) составляет +51,1%, но запросы различаются, поэтому это не изолированный прирост от MTP. Максимальный наблюдавшийся контекст — 2265 токенов; формальная проверка качества ещё не выполнена. Английская сводка и две инфографики · Замеры и источники · Докачка головы, включение и отключение

Документация

Скилл агента · Руководство фреймворка · Документация на русском · Профили запуска · Методика замеров · Подробное сравнение