Локальные LLM Модели
Каталог оптимизированных моделей для домашнего использования. Полная свобода, полная приватность, полный контроль.
26 миллиардов параметров с оптимальным балансом скорости и качества. Идеальна для текстов, кода и анализа.
Многомодальный проекционный слой для визуального анализа изображений. Работает в паре с основной моделью.
Специализированный код-ассистент на 9 миллиардов параметров. Генерация, объяснение и отладка кода на множестве языков.
Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-Q6_K_P
26 миллиардов параметров • Квантование Q6_K • Uncensored
🎯 Особенности
Uncensored
Полностью свободная модель без цензуры. Генерирует любой контент без ограничений.
HauhauCS Оптимизация
Специальная оптимизация для домашнего использования. Максимальная эффективность.
Balanced Режим
Идеальный баланс между скоростью генерации и качеством ответа.
Q6_K Квантование
80% точности от оригинала при значительном снижении размера модели.
💻 Применение
Текстовый анализ
Глубокий анализ документов, статей, и других текстовых материалов.
Кодирование
Генерация, рефакторинг и объяснение кода на различных языках.
Анализ данных
Интерпретация и выводы из больших массивов данных.
Креативное письмо
Создание контента без ограничений по тематике.
📊 Технические характеристики
| Параметр | Значение |
|---|---|
| Полный размер | 26 миллиардов параметров |
| Квантование | Q6_K (80% точности) |
| Размер квантованной модели | ~16-18 GB |
| Точность | 80% от оригинала |
| Скорость генерации | Высокая (Balanced) |
mmproj-Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-f16
Многомодальный проекционный слой • Формат f16
🎨 Особенности
Multi-modal Projection
Проекционный слой для обработки визуальной информации.
Поддержка изображений
Анализ и интерпретация изображений совместно с текстовой моделью.
f16 Формат
16-битный формат для оптимального баланса точности и памяти.
Комбинированная работа
Работает в паре с основной моделью Gemma4-26B.
🖼️ Применение
Визуальный анализ
Описание изображений, распознавание объектов и сцен.
OCR
Распознавание текста на изображениях с высокой точностью.
Визуальный код
Анализ и генерация кода для работы с изображениями.
Комбинированный AI
Создание мультимодальных приложений локально.
📊 Технические характеристики
| Параметр | Значение |
|---|---|
| Тип | Проекционный слой (Projection) |
| Формат весов | f16 (16-бит) |
| Размер слоя | ~2-4 GB |
| Требует совместную работу | Да (с основной моделью) |
omnicoder-9b-bf16
Специализированный код-ассистент • 9 миллиардов параметров
💻 Особенности
Код-специализация
Направлена исключительно на программирование и разработку.
bf16 Формат
Бритый 16-битный формат для точной работы с числами.
Множество языков
Поддержка Python, JavaScript, C++, Java, Go, Rust и многих других.
Эффективность
Меньший размер модели при высокой специализации.
🔧 Применение
Генерация кода
Создание кода с нуля по описанию задачи.
Объяснение кода
Детальный разбор и объяснение любого кода.
Отладка
Поиск и исправление ошибок в коде.
Рефакторинг
Оптимизация и улучшение структуры кода.
📊 Поддерживаемые языки
Языки программирования
Python, JavaScript, TypeScript, Java, C++, C#, Go, Rust, PHP, Ruby
Фреймворки
React, Vue, Django, Flask, Spring, FastAPI, Laravel и др.
Системные языки
Shell, Bash, SQL, GraphQL, Terraform, Dockerfile
Технологии
AI/ML, DevOps, Web, Mobile, Embedded, Desktop
📊 Технические характеристики
| Параметр | Значение |
|---|---|
| Полный размер | 9 миллиардов параметров |
| Квантование | bf16 (бритый 16-бит) |
| Размер модели | ~10-12 GB |
| Специализация | Кодирование и разработка |
📊 Сравнение моделей
| Модель | Параметры | Квантование | VRAM | Специализация |
|---|---|---|---|---|
| Gemma4-26B | 26B | Q6_K (80%) | 16-24 GB | Общая (текст, код, анализ) |
| mmproj-Gemma4 | Projection | f16 (16-bit) | 8-12 GB | Визуальный анализ |
| omnicoder-9b | 9B | bf16 (16-bit) | 8-12 GB | Кодирование |
🎯 Когда использовать какую модель?
🧠 Gemma4-26B
Для общих задач: анализ документов, креативное письмо, комплексные задачи, когда нужна максимальная точность и гибкость.
🎨 mmproj-Gemma4
Для мультимодальных задач: анализ изображений, OCR, визуальное понимание контента. Требует совместной работы с основной моделью.
💻 omnicoder-9b
Для разработки: генерация кода, отладка, рефакторинг, изучение кода. Быстрее и эффективнее для задач программирования.
⚡ Производительность
| Метрика | Gemma4-26B | mmproj-Gemma4 | omnicoder-9b |
|---|---|---|---|
| Скорость токенов/сек | ~15-20 | ~25-30 | ~25-30 |
| Потребление VRAM | Высокое | Среднее | Низкое |
| Точность | Высокая | Средняя | Средняя |
| Общая эффективность | 80% | 75% | 90% |
🖥️ Требования к железу
Рекомендации для запуска локальных LLM моделей
🐌 Слабый ПК
- VRAM: 4-8 GB
- RAM: 16-24 GB
- CPU: 4-6 ядер
- omnicoder-9b (bf16)
- Gemma4-26B (Q4_K, ~8GB)
- Скорость: низкая
⚡ Средний ПК
- VRAM: 8-12 GB
- RAM: 32 GB
- CPU: 6-8 ядер
- omnicoder-9b (bf16)
- mmproj-Gemma4 (f16)
- Gemma4-26B (Q4_K)
- Скорость: средняя
🚀 Сильный ПК
- VRAM: 16-24 GB
- RAM: 32-48 GB
- CPU: 8+ ядер
- Gemma4-26B (Q6_K)
- mmproj-Gemma4 (f16)
- omnicoder-9b (bf16)
- Скорость: высокая
📋 Детальные требования
| Модель | VRAM (GPU) | RAM (CPU) | Рекомендуемая GPU | OS |
|---|---|---|---|---|
| Gemma4-26B Q6_K | 16-24 GB | 32-48 GB | RTX 3080/4070+ | Win 10/11, Linux |
| mmproj-Gemma4 f16 | 8-12 GB | 16-24 GB | RTX 3060/3070+ | Win 10/11, Linux |
| omnicoder-9b bf16 | 8-12 GB | 16-24 GB | RTX 3060/3070 | Win 10/11, Linux |
| Gemma4-26B Q4_K | 8-12 GB | 16-24 GB | RTX 3060 | Win 10/11, Linux |
💡 Оптимизация для CPU
Использование CPU
Модели можно запускать на CPU без GPU, но скорость будет значительно ниже. Используйте Q4_K или Q3_K квантование для экономии памяти.
Swap-память
При нехватке VRAM/RAM используйте swap-файл. Это замедлит работу, но позволит запускать модели.
Оптимизированные библиотеки
Используйте llama.cpp, MLX (Apple), или другие оптимизированные движки для лучшей производительности.
🔧 Программное обеспечение
| Компонент | Рекомендуемая версия | Примечание |
|---|---|---|
| Python | 3.10+ | Для большинства инструментов |
| llama.cpp | Latest | Основной движок для CPU/GPU |
| Ollama | Latest | Простой локальный инференс |
| LM Studio | Latest | GUI для локального запуска |
| ComfyUI | Latest | Для мультимодальных задач |
🚀 Параметры запуска модели
Команда запуска (llama-server)
llama-server \ -m '/model/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-Q6_K_P.gguf' \ --mmproj '/model/visual/mmproj-Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-f16.gguf' \ --host 0.0.0.0 \ --port 8000 \ -ngl 99 \ --tensor-split 4,4,4,4 \ --flash-attn on \ -c 262144 \ --cache-type-k q8_0 \ --cache-type-v q8_0 \ -b 4096 \ -ub 1024 \ -t 44 \ -tb 44 \ --temp 0.8 \ --top-p 0.95 \ --top-k 40 \ --min-p 0.05 \ --reasoning on
📊 Анализ производительности железа
На основе анализа логов работы модели Gemma4-26B, ваша система демонстрирует выдающиеся показатели:
-
Скорость генерации (Token Generation): Стабильно держится в районе ~100 tokens/s. Это невероятно высокий показатель для модели такого размера, что подтверждает практически полную загрузку видеопамяти (VRAM) и эффективную работу тензорного расщепления (
--tensor-split 4,4,4,4). - Скорость обработки промпта (Prompt Processing): Достигает ~780-2200 tokens/s, что обеспечивает мгновенную реакцию модели на длинные входные данные.
-
Конфигурация: Использование 44 потоков и максимального переноса слоев на GPU (
-ngl 99) позволяет выжать максимум из доступного железа.
💡 Итог: Ваше железо идеально подходит для работы с этой моделью, обеспечивая практически мгновенный отклик и высочайшую скорость генерации.