Mac mini с OpenClaw: тестируем локальный инференс LLM на M4 Pro

AppleApple Google/DeepMindGoogle/DeepMind
На Mac mini M4 Pro с 48 ГБ памяти протестировали связку OpenClaw и LM Studio для локального инференса LLM. Из нескольких моделей лучшие результаты по скорости и энергоэффективности показали MoE-модели, а самая большая плотная модель работала в 5 раз медленнее.
В статье проверяют возможность использования Mac mini M4 Pro (48 ГБ ОЗУ) для локального инференса LLM через OpenClaw — self-hosted шлюз для ИИ-агентов. Модели запускали через LM Studio, которая предоставляет OpenAI-совместимый API. OpenClaw сам по себе нетребователен к ресурсам, но при локальном размещении модели ключевым ограничением становится объём памяти, так как она унифицирована (UMA). Из нескольких загруженных моделей для тестов отобрали три: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b и google/gemma-4-31b. Сначала измерили время ответа на запрос о новостях: gemma-4-26b-a4b-qat и qwen3.6-35b-a3b ответили за 60 секунд, а gemma-4-31b — за 300 секунд. Самый детальный ответ дала qwen3.6-35b-a3b. Затем в синтетических бенчмарках Anubis замерили скорость токенов в секунду: gemma-4-26b-a4b-qat показала 59 токен/с, qwen3.6-35b-a3b — 50 токен/с, а gemma-4-31b — всего 10 токен/с. Энергопотребление на токен у MoE-моделей было в 6–7 раз ниже, чем у плотной 31B. Загрузка GPU достигала 99%, CPU — менее 10%. Вывод: MoE-модели (gemma-4-26b-a4b-qat и qwen3.6-35b-a3b) значительно быстрее и энергоэффективнее на Mac mini с UMA, а плотная 31B модель показала худшие результаты и по скорости, и по качеству ответа.
Сокращения
UMA = Unified Memory Architecture — архитектура унифицированной памяти
MoE = Mixture of Experts — смесь экспертов
TTFT = Time to First Token — время до первого токена
Источник: Habr — хаб ИИ — оригинал

Наши прошлые публикации по теме

Есть свежие новости