Запись архива

Измеренные скорости инференса LLM на Apple Silicon: публичные бенчмарки с сырыми данными

На Hacker News появилась ссылка на открытый бенчмарк Macyou, где замерена реальная скорость генерации LLM на Apple Silicon. Данные в формате JSON под CC BY 4.0, методология прозрачна, но обсуждение пока только начинается.

График скорости генерации LLM на чипах Apple Silicon M4 Pro, M4 Max, M3 Ultra
График скорости генерации LLM на чипах Apple Silicon M4 Pro, M4 Max, M3 Ultra
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Что произошло

На Hacker News опубликована ссылка на бенчмарк-проект Macyou, где собраны измерения скорости инференса LLM на реальном парке Apple Silicon. Авторы утверждают, что все цифры получены на собственном production-железе, а не взяты из спецификаций. Для каждого чипа используется фиксированный промпт, генерация 512 токенов, медиана трёх запусков через Ollama API. Сырые данные (JSON) выложены под лицензией CC BY 4.0.

Почему это обсуждают

Apple Silicon — популярная платформа для запуска локальных LLM, но независимых бенчмарков с открытой методологией мало. Публикация Macyou даёт прозрачный срез: измерены M4 Pro (Mac mini), M4 Max (Mac Studio) и M3 Ultra (Mac Studio). Основной вывод — скорость генерации предсказуемо линейно зависит от пропускной способности памяти (273, 546, 819 ГБ/с соответственно). Это подтверждает тезис, что узким местом на Apple Silicon является именно память, а не вычислительные ядра. Однако обсуждение на HN только началось (2 очка, 0 комментариев), поэтому реакция сообщества ещё впереди.

Что подтверждено

Пункт Деталь
Платформа macOS 15.3.1 (Sequoia), Ollama 0.31.2 (llama.cpp + Metal)
Измеренные чипы M4 Pro, M4 Max, M3 Ultra (все в Mac Studio / Mac mini)
Методология Один warm-up (отбрасывается), 3 прогона, фиксированный промпт, num_predict=512, temperature=0.7
Формат данных Сырые записи в JSON, медиана и разброс (max-min)
Лицензия CC BY 4.0, требуется ссылка на “Macyou Apple Silicon LLM Benchmarks”

Авторы прямо указывают, что модель по умолчанию квантизована Q4_K_M. Скорость замерена по собственным счётчикам Ollama (eval_count / eval_duration). Машина во время тестов была простаивающей, кроме системных процессов.

Что остаётся неясным

Пока нет данных по другим чипам (например, M2 Ultra, M1 Max) — авторы обещают расширять парк по мере возможности. Неясно, как методология ведёт себя на других моделях, промптах и температурах. Также нет сравнения с GPU NVIDIA или AMD, что было бы полезно для контекста. Нулевое количество комментариев на HN может означать, что бенчмарк ещё не прошёл рецензирование сообществом. Стоит следить за обновлениями — возможно, появятся дополнительные тесты или критика методологии.

Исходный источник: https://macyou.co/benchmarks (Hacker News: https://news.ycombinator.com/item?id=49077193). Последующие материалы и обсуждения — на verification lead: https://comrad404.com/pulse/