Pre-training (предобучение)
Pre-training, или предобучение, — это обучение модели с нуля на большом корпусе данных, обычно self-supervised, чтобы затем донастроить её под конкретную задачу.
Открыть →Короткие и проверяемые определения терминов.
Pre-training, или предобучение, — это обучение модели с нуля на большом корпусе данных, обычно self-supervised, чтобы затем донастроить её под конкретную задачу.
Открыть →Mixture of Experts (MoE) — разреженная архитектура условных вычислений, где роутер активирует только часть экспертов для каждого токена. Разбираем схему работы, примеры Mixtral и Qwen, отличия от Switch Transformer и ограничения при выборе модели.
Открыть →Модель рассуждений (reasoning model) — это модель для сложных многошаговых задач. В статье — трактовка OpenAI: как работает reasoning.effort, чем отличаются GPT-5.6, o3-pro и gpt-oss и какие ограничения доступа важно проверить.
Открыть →Chain-of-Thought (CoT) — это серия промежуточных шагов рассуждения перед ответом модели. Ниже — что означает CoT, как работает CoT prompting, когда reasoning видим пользователю и где проходят границы термина.
Открыть →Системный промпт (system prompt) — это привилегированный слой инструкций для LLM, который приложение задаёт отдельно от пользовательского текста. Но его сила, синтаксис и токен-стоимость зависят от провайдера, модели и снимка модели.
Открыть →Промпт — это входной запрос к LLM: текст, а в некоторых системах также изображение или аудио. В статье — структура промпта, few-shot примеры, system instructions, ограничения и практический шаблон.
Открыть →Галлюцинации LLM — это правдоподобные, но фактически неверные ответы модели: от ошибочных фактов до выдуманных цитат и ссылок. Объясняем механику, отличия и способы снизить риск.
Открыть →Температура (temperature) — параметр генерации в LLM, который регулирует случайность выбора следующего токена. Ниже — как она работает, когда помогает и почему в части новых моделей её лучше не менять вручную.
Открыть →Embeddings, или векторные представления, — это числовые векторы, которые кодируют смысл текста, изображений и других объектов, чтобы их можно было сравнивать по близости, искать, кластеризовать и использовать в рекомендациях.
Открыть →Внимание (attention mechanism) — механизм, который позволяет трансформеру по-разному учитывать части входа при расчёте ответа. Разбираем схему работы, full vs sparse attention, SDPA и ограничения.
Открыть →