Параметры модели
Параметры модели управляют тем, как LLM генерирует текст: креативностью, длиной ответа и стратегией сэмплирования. Правильная настройка этих параметров может заметно улучшить качество AI-вывода и лучше адаптировать его под ваш сценарий.
Когда использовать
- Ответы по умолчанию слишком случайные или слишком жёсткие, и нужно настроить креативность
- Ответы часто обрываются, и нужно увеличить ограничение длины вывода
- Вы используете reasoning-модель и хотите управлять глубиной размышления
- Для разных задач нужны разные комбинации параметров (творческое письмо vs. генерация кода)
Где настраивать параметры
Elftia предоставляет несколько уровней настройки параметров со следующим приоритетом (от высокого к низкому):
Параметры уровня сессии (временная настройка в окне чата)
|
v overrides
Глобальные параметры модели (Settings → Model Parameters)
|
v overrides
Параметры провайдера по умолчанию (defaultSettings в конфигурации провайдера)
|
v overrides
Системные значения по умолчанию
Глобальные параметры модели
- Откройте Settings → Model Parameters
- Измените значение каждого параметра
- Используйте переключатель Enable/Disable рядом с каждым параметром, чтобы управлять его применением
Параметры уровня сессии
- В интерфейсе чата нажмите кнопку Parameters рядом с областью выбора модели
- Временно измените параметры для текущей сессии
- Эти изменения применяются только к текущей сессии
Основные параметры
temperature
| Свойство | Значение |
|---|---|
| Диапазон | 0 – 2 |
| По умолчанию | 0.7 |
| Глобальное управление | Да |
Назначение: управляет случайностью и креативностью вывода.
- Низкий temperature (0 – 0.3): вывод более детерминированный и стабильный — подходит для генерации кода, фактических Q&A, извлечения данных и других сценариев, требующих точности
- Средний temperature (0.4 – 0.8): балансирует креативность и стабильность — подходит для повседневного общения и написания документации
- Высокий temperature (0.9 – 2.0): вывод более случайный и креативный — подходит для творческого письма и брейнсторминга
Рекомендуемые значения:
| Сценарий | Рекомендуемое значение |
|---|---|
| Генерация кода | 0 – 0.2 |
| Техническая документация | 0.3 – 0.5 |
| Повседневное общение | 0.6 – 0.8 |
| Творческое письмо | 0.8 – 1.2 |
| Брейнсторминг | 1.0 – 1.5 |
max_tokens
| Свойство | Значение |
|---|---|
| Диапазон | 1 – (лимит модели) |
| По умолчанию | 4096 |
| Глобальное управление | Да |
Назначение: ограничивает максимальную длину одного ответа модели (измеряется в token — примерно 1–2 token на один китайский иероглиф и около 1 token на английское слово).
- Если ответ обрывается посреди фразы и появляется сообщение о достижении максимальной длины, значит
max_tokensслишком мал - Очень большое значение не заставляет модель всегда генерировать длинные ответы — модель останавливается естественно, когда считает ответ завершённым
- У разных моделей разные лимиты; значения выше максимума модели автоматически ограничиваются
Типичные лимиты вывода моделей:
| Модель | Максимум output token |
|---|---|
| GPT-4o | 16,384 |
| GPT-5 | 65,536 |
| Claude Sonnet 4.5 | 65,536 |
| Claude Haiku 4.5 | 65,536 |
| Gemini 3 Flash | 65,536 |
| Qwen3 Max | 65,536 |
| DeepSeek V3 | 8,192 |
top_p
| Свойство | Значение |
|---|---|
| Диапазон | 0 – 1 |
| По умолчанию | 1.0 |
| Глобальное управление | Да |
Назначение: Nucleus Sampling — ещё один способ управлять случайностью. При генерации каждого token модель выбирает только из кандидатов, чья суммарная вероятность достигает top_p.
- top_p = 1.0: учитываются все кандидаты token (без фильтрации)
- top_p = 0.9: выборка только из наиболее вероятных token, которые вместе составляют 90% вероятностной массы
- top_p = 0.1: выборка только из наиболее вероятных token, которые вместе составляют 10%; вывод становится очень детерминированным
Примечание: обычно рекомендуется изменять только один из параметров temperature или top_p за раз; существенное изменение обоих может давать непредсказуемые результаты.
Thinking Budget
| Свойство | Значение |
|---|---|
| Варианты | none / low / medium / high |
| По умолчанию | low |
| Глобальное управление | Да |
Назначение: управляет глубиной "размышления" reasoning-моделей (например Claude Sonnet 4.5, Gemini 3 Flash, DeepSeek R1 и других моделей с поддержкой reasoning) перед ответом.
| Уровень | Описание | Сценарий |
|---|---|---|
| none | Reasoning отключён; модель отвечает напрямую | Простые Q&A, обычный чат |
| low | Лёгкое размышление | Повседневные задачи — баланс скорости и качества |
| medium | Умеренное размышление | Сложные вопросы, требующие некоторого reasoning |
| high | Глубокое размышление с максимальным token-бюджетом | Математические доказательства, сложный код, глубокий анализ |
Thinking budget действует только для моделей с reasoning: true. Для моделей без поддержки reasoning эта настройка игнорируется.
reasoning_effort
Этот параметр относится к моделям OpenAI серии o (например o1, o3, o4-mini).
| Свойство | Значение |
|---|---|
| Варианты | low / medium / high |
| По умолчанию | medium |
- low: быстрый ответ, подходит для простых вопросов
- medium: сбалансированный режим
- high: глубокий reasoning, подходит для сложных задач
Tool Max Turns
| Свойство | Значение |
|---|---|
| Диапазон | 1 – 50 |
| По умолчанию | 5 |
| Глобальное управление | Да |
Назначение: ограничивает максимальное число итераций вызова MCP tools в режиме Agent. Если модель в рамках одного диалога последовательно вызывает tools, при достижении этого лимита процесс принудительно останавливается и возвращает текущий результат.
Справочник настроек
Глобальные параметры модели
| Параметр | Тип | По умолчанию | Диапазон | Enable/Disable |
|---|---|---|---|---|
| temperature | Number | 0.7 | 0 – 2 | Включён по умолчанию |
| topP | Number | 1.0 | 0 – 1 | Отключён по умолчанию |
| maxTokens | Number | 4096 | 1 – (лимит модели) | Отключён по умолчанию |
| defaultThinkingBudget | Enum | low | none/low/medium/high | Всегда активен |
| toolMaxTurns | Number | 5 | 1 – 50 | Всегда активен |
Параметры провайдера по умолчанию
| Параметр | Тип | Системное значение | Описание |
|---|---|---|---|
| temperature | Number | 0.7 | Temperature по умолчанию на уровне провайдера |
| topP | Number | 1 | top_p по умолчанию на уровне провайдера |
| maxTokens | Number | 4096 | Максимальный вывод по умолчанию на уровне провайдера |
| stream | Boolean | true | Использовать ли streaming |
| presencePenalty | Number | (не задано) | Presence penalty (–2 до 2) |
| frequencyPenalty | Number | (не задано) | Frequency penalty (–2 до 2) |
| stop | String array | (не задано) | Stop sequences |
| seed | Number | (не задано) | Random seed (для воспроизводимого вывода) |
| jsonMode | Boolean | false | Принудительно выводить JSON |
Различия параметров по умолчанию между провайдерами
У разных шаблонов провайдеров разные параметры по умолчанию:
| Провайдер | temperature | maxTokens | topP | Другое |
|---|---|---|---|---|
| OpenAI | 0.7 | 4,096 | -- | -- |
| Anthropic | 0.7 | 65,536 | -- | -- |
| Google Gemini | 0.7 | 65,536 | 0.95 | -- |
| Системное значение | 0.7 | 4,096 | 1 | stream: true |
Примечания к поведению
Приоритет параметров
Когда один и тот же параметр задан на нескольких уровнях, приоритет следующий:
- Параметры уровня сессии (временно настроенные в чате) — высший приоритет
- Глобальные параметры модели (заданы на странице настроек и отмечены как "enabled")
- Параметры провайдера по умолчанию (
defaultSettingsв конфигурации провайдера) - Системные значения по умолчанию (
temperature: 0.7, topP: 1, maxTokens: 4096)
Глобальные параметры модели, отмеченные как "disabled", не переопределяют значения провайдера по умолчанию.
Совместимость параметров с моделями
Не все параметры поддерживаются всеми моделями:
| Параметр | OpenAI | Anthropic | Gemini | Локальные модели |
|---|---|---|---|---|
| temperature | Поддерживается | Поддерживается | Поддерживается | Поддерживается |
| maxTokens | Поддерживается | Поддерживается | Поддерживается | Поддерживается |
| topP | Поддерживается | Поддерживается | Поддерживается | Поддерживается |
| presencePenalty | Поддерживается | Не поддерживается | Не поддерживается | Частично поддерживается |
| frequencyPenalty | Поддерживается | Не поддерживается | Не поддерживается | Частично поддерживается |
| seed | Поддерживается | Не поддерживается | Не поддерживается | Частично поддерживается |
| thinking | Частично (серия o) | Поддерживается | Поддерживается | Не поддерживается |
Неподдерживаемые параметры автоматически удаляются Transformer перед отправкой запроса, поэтому ошибка не возникает.
Влияние Transformer на параметры
Система Transformer в Elftia адаптирует параметры перед отправкой запроса:
| Transformer | Обработка параметров |
|---|---|
anthropic | Сопоставляет max_tokens с форматом поля Anthropic |
gemini | Преобразует параметры в формат Gemini generationConfig |
sampling | Нормализует параметры сэмплирования, такие как temperature и top_p |
maxtoken | Принудительно задаёт конкретное значение max_tokens (переопределяет настройку пользователя) |
maxcompletiontokens | Преобразует max_tokens в max_completion_tokens (требуется некоторым моделям) |
reasoning | Обрабатывает поле reasoning_content для reasoning-моделей |
forcereasoning | Принудительно включает reasoning-режим (игнорирует настройку thinking budget пользователя) |
Маршрутизация моделей
Elftia поддерживает настройку разных моделей для разных типов задач:
| Роль маршрутизации | Описание | Где настраивается |
|---|---|---|
| Модель по умолчанию | Основная модель чата | Выбор модели в интерфейсе чата |
| Фоновая модель | Используется для лёгких задач (резюме, генерация заголовков и т. п.) | Settings → Agent Default Models |
| Vision-модель | Обрабатывает сообщения с изображениями, если модель по умолчанию не поддерживает vision | Settings → Agent Default Models |
| Reasoning-модель | Задачи, требующие глубокого размышления | Управляется уровнем thinking budget |
Follow Provider: если эта опция включена, фоновая и vision-модель автоматически используют соответствующие модели того же провайдера, что и текущая модель по умолчанию. Например, если вы используете Zhipu GLM-5 как модель по умолчанию, фоновая модель автоматически будет GLM-4.5 Air, а vision-модель — GLM-4.6V.
Устранение неполадок
| Проблема | Возможная причина | Решение |
|---|---|---|
| Ответы обрываются | max_tokens слишком мал | Увеличьте значение max_tokens или включите его в глобальных параметрах и задайте большее значение |
| Ответы слишком случайные или нерелевантные | temperature слишком высокий | Уменьшите temperature (рекомендуется 0.3–0.7) |
| Ответы слишком жёсткие или повторяющиеся | temperature слишком низкий | Немного увеличьте temperature (рекомендуется 0.5–0.8) |
| Reasoning-модель не показывает chain-of-thought | thinking budget установлен в none | Установите defaultThinkingBudget в low или выше |
| Reasoning-модель думает слишком долго | thinking budget установлен в high | Уменьшите до medium или low |
| Настройки параметров не применяются | Их переопределяет настройка с более высоким приоритетом | Проверьте, не переопределяют ли их параметры уровня сессии; убедитесь, что переключатель глобального параметра включён |
| Запрос возвращает ошибку параметра | Модель не поддерживает конкретный параметр | Проверьте совместимость параметра с моделью и отключите несовместимый параметр |
| Вызовы tools останавливаются посреди диалога | Достигнут лимит toolMaxTurns | Увеличьте значение toolMaxTurns (учтите, что это может увеличить API-стоимость) |
| У разных провайдеров сильно отличается поведение | У провайдеров разные параметры по умолчанию | Включите глобальные параметры и задайте ключевые параметры одинаково |
Связанные страницы
- Обзор LLM Providers - понять систему провайдеров и format transformers
- Добавление провайдера - настроить параметры по умолчанию при конфигурации провайдера
- API Key Pools - управление несколькими ключами и балансировка нагрузки
- Пользовательские endpoints - примечания по совместимости параметров для локальных моделей