English · Русский · 简体中文 · Español
September 18 update (English): Bonsai benchmarks · REAP / APEX rebuild · Jev API + browser-use · Updated graphics.
Большие модели на железе, которое у вас уже есть. LocalForgeLLM — фреймворк, с которым ваш кодинг-агент собирает и оптимизирует локальный AI-стек. Укажите задачу и, при желании, MoE-модель; агент подбирает модель, движок, квантование и параметры запуска под ваше оборудование. Готовый стек можно использовать для локального чата, зрения и кодинг-агентов.
Стек: AI-агенты · документация моделей и движков · Python / Bash · движки инференса, например llama.cpp · бэкенды CPU / GPU · локальный HTTP API.
Что нужно: кодинг-агент с доступом к терминалу и место для выбранной модели. Зависимости и настройки памяти агент подбирает под ваш компьютер.
- Откройте этот репозиторий в своём кодинг-агенте и попросите прочитать AGENTS.md и SKILL.md.
- Опишите задачу, нужный размер контекста и бюджет RAM/VRAM. Укажите модель или доверьте её выбор агенту.
- Попросите агента по документации фреймворка установить движок, настроить модель и сохранить рабочий профиль запуска.
Для конкретного примера начните с наших профилей запуска Qwen и Gemma.
Агент изучает ваше железо и документацию моделей, подбирает модель, совместимый движок и формат весов, затем настраивает распределение CPU/GPU, контекст, кеш и батчи. Запускает вашу задачу, замеряет скорость и память, корректирует настройки и сохраняет лучший рабочий профиль. Этот цикл подходит для разных семейств MoE и методов квантования.
Ryzen 5 5600 · 32 ГБ RAM · 8 ГБ VRAM · контекст 32K · 10 сентября 2026 года. В этих двух профилях используются APEX GGUF + llama.cpp / Vulkan.
| Модель / профиль | Генерация | RAM | VRAM модели |
|---|---|---|---|
| Qwen3.6 35B-A3B · I-Compact | 21.11 токена/с | пик RSS 13.43 ГиБ | 4.07 ГиБ |
| Gemma 4 26B-A4B Heretic · I-Balanced + зрение | 9.78 токена/с | лимит службы 11 ГиБ | снимок 4.88 ГиБ |
Qwen: 28 запросов, до 29,087 токенов контекста. Gemma: один запрос с подключённым зрением. Указана скорость генерации токенов.
Наша скорость Qwen — 2.13× от заявленной прогретой скорости Colibri и на 46.3% ниже заявленной скорости FreeToken на показанных выше конфигурациях. Модель на 35B параметров работает здесь с пиком RSS 13.43 ГиБ и VRAM модели 4.07 ГиБ. Настройки, определения показателей и источники →
Обновление от 11 сентября: 14,83 токена/с в среднем по двум запросам; длинный ответ — 1535 выходных токенов за 102,05 с генерации, 15,03 токена/с. Основная модель остаётся Heretic APEX I-Balanced; Q8_0 — отдельная MTP-голова. Распределение основных весов и окно 32K сохранены.
Разница с предшествующим запросом без MTP (9,81 токена/с) составляет +51,1%, но запросы различаются, поэтому это не изолированный прирост от MTP. Максимальный наблюдавшийся контекст — 2265 токенов; формальная проверка качества ещё не выполнена. Английская сводка и две инфографики · Замеры и источники · Докачка головы, включение и отключение
Скилл агента · Руководство фреймворка · Документация на русском · Профили запуска · Методика замеров · Подробное сравнение