Перейти к основному содержимому

Параметры модели

Параметры модели управляют тем, как LLM генерирует текст: креативностью, длиной ответа и стратегией сэмплирования. Правильная настройка этих параметров может заметно улучшить качество AI-вывода и лучше адаптировать его под ваш сценарий.

Когда использовать

  • Ответы по умолчанию слишком случайные или слишком жёсткие, и нужно настроить креативность
  • Ответы часто обрываются, и нужно увеличить ограничение длины вывода
  • Вы используете reasoning-модель и хотите управлять глубиной размышления
  • Для разных задач нужны разные комбинации параметров (творческое письмо vs. генерация кода)

Где настраивать параметры

Elftia предоставляет несколько уровней настройки параметров со следующим приоритетом (от высокого к низкому):

Параметры уровня сессии (временная настройка в окне чата)
|
v overrides
Глобальные параметры модели (Settings → Model Parameters)
|
v overrides
Параметры провайдера по умолчанию (defaultSettings в конфигурации провайдера)
|
v overrides
Системные значения по умолчанию

Глобальные параметры модели

  1. Откройте SettingsModel Parameters
  2. Измените значение каждого параметра
  3. Используйте переключатель Enable/Disable рядом с каждым параметром, чтобы управлять его применением

Параметры уровня сессии

  1. В интерфейсе чата нажмите кнопку Parameters рядом с областью выбора модели
  2. Временно измените параметры для текущей сессии
  3. Эти изменения применяются только к текущей сессии

Основные параметры

temperature

СвойствоЗначение
Диапазон0 – 2
По умолчанию0.7
Глобальное управлениеДа

Назначение: управляет случайностью и креативностью вывода.

  • Низкий temperature (0 – 0.3): вывод более детерминированный и стабильный — подходит для генерации кода, фактических Q&A, извлечения данных и других сценариев, требующих точности
  • Средний temperature (0.4 – 0.8): балансирует креативность и стабильность — подходит для повседневного общения и написания документации
  • Высокий temperature (0.9 – 2.0): вывод более случайный и креативный — подходит для творческого письма и брейнсторминга

Рекомендуемые значения:

СценарийРекомендуемое значение
Генерация кода0 – 0.2
Техническая документация0.3 – 0.5
Повседневное общение0.6 – 0.8
Творческое письмо0.8 – 1.2
Брейнсторминг1.0 – 1.5

max_tokens

СвойствоЗначение
Диапазон1 – (лимит модели)
По умолчанию4096
Глобальное управлениеДа

Назначение: ограничивает максимальную длину одного ответа модели (измеряется в token — примерно 1–2 token на один китайский иероглиф и около 1 token на английское слово).

  • Если ответ обрывается посреди фразы и появляется сообщение о достижении максимальной длины, значит max_tokens слишком мал
  • Очень большое значение не заставляет модель всегда генерировать длинные ответы — модель останавливается естественно, когда считает ответ завершённым
  • У разных моделей разные лимиты; значения выше максимума модели автоматически ограничиваются

Типичные лимиты вывода моделей:

МодельМаксимум output token
GPT-4o16,384
GPT-565,536
Claude Sonnet 4.565,536
Claude Haiku 4.565,536
Gemini 3 Flash65,536
Qwen3 Max65,536
DeepSeek V38,192

top_p

СвойствоЗначение
Диапазон0 – 1
По умолчанию1.0
Глобальное управлениеДа

Назначение: Nucleus Sampling — ещё один способ управлять случайностью. При генерации каждого token модель выбирает только из кандидатов, чья суммарная вероятность достигает top_p.

  • top_p = 1.0: учитываются все кандидаты token (без фильтрации)
  • top_p = 0.9: выборка только из наиболее вероятных token, которые вместе составляют 90% вероятностной массы
  • top_p = 0.1: выборка только из наиболее вероятных token, которые вместе составляют 10%; вывод становится очень детерминированным

Примечание: обычно рекомендуется изменять только один из параметров temperature или top_p за раз; существенное изменение обоих может давать непредсказуемые результаты.

Thinking Budget

СвойствоЗначение
Вариантыnone / low / medium / high
По умолчаниюlow
Глобальное управлениеДа

Назначение: управляет глубиной "размышления" reasoning-моделей (например Claude Sonnet 4.5, Gemini 3 Flash, DeepSeek R1 и других моделей с поддержкой reasoning) перед ответом.

УровеньОписаниеСценарий
noneReasoning отключён; модель отвечает напрямуюПростые Q&A, обычный чат
lowЛёгкое размышлениеПовседневные задачи — баланс скорости и качества
mediumУмеренное размышлениеСложные вопросы, требующие некоторого reasoning
highГлубокое размышление с максимальным token-бюджетомМатематические доказательства, сложный код, глубокий анализ

Thinking budget действует только для моделей с reasoning: true. Для моделей без поддержки reasoning эта настройка игнорируется.

reasoning_effort

Этот параметр относится к моделям OpenAI серии o (например o1, o3, o4-mini).

СвойствоЗначение
Вариантыlow / medium / high
По умолчаниюmedium
  • low: быстрый ответ, подходит для простых вопросов
  • medium: сбалансированный режим
  • high: глубокий reasoning, подходит для сложных задач

Tool Max Turns

СвойствоЗначение
Диапазон1 – 50
По умолчанию5
Глобальное управлениеДа

Назначение: ограничивает максимальное число итераций вызова MCP tools в режиме Agent. Если модель в рамках одного диалога последовательно вызывает tools, при достижении этого лимита процесс принудительно останавливается и возвращает текущий результат.

Справочник настроек

Глобальные параметры модели

ПараметрТипПо умолчаниюДиапазонEnable/Disable
temperatureNumber0.70 – 2Включён по умолчанию
topPNumber1.00 – 1Отключён по умолчанию
maxTokensNumber40961 – (лимит модели)Отключён по умолчанию
defaultThinkingBudgetEnumlownone/low/medium/highВсегда активен
toolMaxTurnsNumber51 – 50Всегда активен

Параметры провайдера по умолчанию

ПараметрТипСистемное значениеОписание
temperatureNumber0.7Temperature по умолчанию на уровне провайдера
topPNumber1top_p по умолчанию на уровне провайдера
maxTokensNumber4096Максимальный вывод по умолчанию на уровне провайдера
streamBooleantrueИспользовать ли streaming
presencePenaltyNumber(не задано)Presence penalty (–2 до 2)
frequencyPenaltyNumber(не задано)Frequency penalty (–2 до 2)
stopString array(не задано)Stop sequences
seedNumber(не задано)Random seed (для воспроизводимого вывода)
jsonModeBooleanfalseПринудительно выводить JSON

Различия параметров по умолчанию между провайдерами

У разных шаблонов провайдеров разные параметры по умолчанию:

ПровайдерtemperaturemaxTokenstopPДругое
OpenAI0.74,096----
Anthropic0.765,536----
Google Gemini0.765,5360.95--
Системное значение0.74,0961stream: true

Примечания к поведению

Приоритет параметров

Когда один и тот же параметр задан на нескольких уровнях, приоритет следующий:

  1. Параметры уровня сессии (временно настроенные в чате) — высший приоритет
  2. Глобальные параметры модели (заданы на странице настроек и отмечены как "enabled")
  3. Параметры провайдера по умолчанию (defaultSettings в конфигурации провайдера)
  4. Системные значения по умолчанию (temperature: 0.7, topP: 1, maxTokens: 4096)

Глобальные параметры модели, отмеченные как "disabled", не переопределяют значения провайдера по умолчанию.

Совместимость параметров с моделями

Не все параметры поддерживаются всеми моделями:

ПараметрOpenAIAnthropicGeminiЛокальные модели
temperatureПоддерживаетсяПоддерживаетсяПоддерживаетсяПоддерживается
maxTokensПоддерживаетсяПоддерживаетсяПоддерживаетсяПоддерживается
topPПоддерживаетсяПоддерживаетсяПоддерживаетсяПоддерживается
presencePenaltyПоддерживаетсяНе поддерживаетсяНе поддерживаетсяЧастично поддерживается
frequencyPenaltyПоддерживаетсяНе поддерживаетсяНе поддерживаетсяЧастично поддерживается
seedПоддерживаетсяНе поддерживаетсяНе поддерживаетсяЧастично поддерживается
thinkingЧастично (серия o)ПоддерживаетсяПоддерживаетсяНе поддерживается

Неподдерживаемые параметры автоматически удаляются Transformer перед отправкой запроса, поэтому ошибка не возникает.

Влияние Transformer на параметры

Система Transformer в Elftia адаптирует параметры перед отправкой запроса:

TransformerОбработка параметров
anthropicСопоставляет max_tokens с форматом поля Anthropic
geminiПреобразует параметры в формат Gemini generationConfig
samplingНормализует параметры сэмплирования, такие как temperature и top_p
maxtokenПринудительно задаёт конкретное значение max_tokens (переопределяет настройку пользователя)
maxcompletiontokensПреобразует max_tokens в max_completion_tokens (требуется некоторым моделям)
reasoningОбрабатывает поле reasoning_content для reasoning-моделей
forcereasoningПринудительно включает reasoning-режим (игнорирует настройку thinking budget пользователя)

Маршрутизация моделей

Elftia поддерживает настройку разных моделей для разных типов задач:

Роль маршрутизацииОписаниеГде настраивается
Модель по умолчаниюОсновная модель чатаВыбор модели в интерфейсе чата
Фоновая модельИспользуется для лёгких задач (резюме, генерация заголовков и т. п.)Settings → Agent Default Models
Vision-модельОбрабатывает сообщения с изображениями, если модель по умолчанию не поддерживает visionSettings → Agent Default Models
Reasoning-модельЗадачи, требующие глубокого размышленияУправляется уровнем thinking budget

Follow Provider: если эта опция включена, фоновая и vision-модель автоматически используют соответствующие модели того же провайдера, что и текущая модель по умолчанию. Например, если вы используете Zhipu GLM-5 как модель по умолчанию, фоновая модель автоматически будет GLM-4.5 Air, а vision-модель — GLM-4.6V.

Устранение неполадок

ПроблемаВозможная причинаРешение
Ответы обрываютсяmax_tokens слишком малУвеличьте значение max_tokens или включите его в глобальных параметрах и задайте большее значение
Ответы слишком случайные или нерелевантныеtemperature слишком высокийУменьшите temperature (рекомендуется 0.3–0.7)
Ответы слишком жёсткие или повторяющиесяtemperature слишком низкийНемного увеличьте temperature (рекомендуется 0.5–0.8)
Reasoning-модель не показывает chain-of-thoughtthinking budget установлен в noneУстановите defaultThinkingBudget в low или выше
Reasoning-модель думает слишком долгоthinking budget установлен в highУменьшите до medium или low
Настройки параметров не применяютсяИх переопределяет настройка с более высоким приоритетомПроверьте, не переопределяют ли их параметры уровня сессии; убедитесь, что переключатель глобального параметра включён
Запрос возвращает ошибку параметраМодель не поддерживает конкретный параметрПроверьте совместимость параметра с моделью и отключите несовместимый параметр
Вызовы tools останавливаются посреди диалогаДостигнут лимит toolMaxTurnsУвеличьте значение toolMaxTurns (учтите, что это может увеличить API-стоимость)
У разных провайдеров сильно отличается поведениеУ провайдеров разные параметры по умолчаниюВключите глобальные параметры и задайте ключевые параметры одинаково

Связанные страницы