Локальные LLM в продакшене: что изменилось с выходом llama.cpp v0.5.0
Релиз llama.cpp v0.5.0 принес поддержку Flash Attention, Metal GPU и принципиально новую архитектуру для инференса на CPU/GPU. Разбираем, что это меняет для разработчиков агентов и автономных пайплайнов.
Открыть материал →
