본문으로 건너뛰기

모델 파라미터

모델 파라미터는 LLM이 텍스트를 생성하는 방식을 제어합니다 — 창의성, 출력 길이, 샘플링 전략 등이 이에 해당합니다. 파라미터를 적절히 조정하면 AI 출력 품질을 크게 향상시키고 사용 목적에 더 잘 맞출 수 있습니다.

사용 시기

  • 기본 출력이 너무 무작위하거나 너무 경직되어 창의성을 조정하고 싶을 때
  • 응답이 자주 잘리고 출력 길이 제한을 늘려야 할 때
  • 추론 모델을 사용 중이고 사고 깊이를 제어하고 싶을 때
  • 시나리오별로 다른 파라미터 조합이 필요할 때 (창의적 글쓰기 대 코드 생성)

파라미터 설정 위치

Elftia는 여러 단계의 파라미터 설정을 제공하며, 다음과 같은 우선순위를 따릅니다 (높음에서 낮음 순):

세션 수준 파라미터 (채팅 창에서 임시 조정)
|
v 재정의
전역 모델 파라미터 (설정 → 모델 파라미터)
|
v 재정의
프로바이더 기본 파라미터 (프로바이더 설정의 defaultSettings)
|
v 재정의
시스템 기본값

전역 모델 파라미터

  1. 설정모델 파라미터를 엽니다
  2. 각 파라미터 값을 조정합니다
  3. 각 파라미터 옆의 활성화/비활성화 토글로 적용 여부를 제어합니다

세션 수준 파라미터

  1. 채팅 UI에서 모델 선택 영역 옆의 파라미터 버튼을 클릭합니다
  2. 현재 세션의 파라미터를 임시로 조정합니다
  3. 이 조정은 현재 세션에만 적용됩니다

핵심 파라미터 설명

temperature

속성
범위0 – 2
기본값0.7
전역 제어

목적: 출력의 무작위성과 창의성을 제어합니다.

  • 낮은 temperature (0 – 0.3): 출력이 더 결정적이고 일관됩니다 — 코드 생성, 사실 Q&A, 데이터 추출 등 정밀함이 요구되는 시나리오에 적합합니다
  • 중간 temperature (0.4 – 0.8): 창의성과 일관성의 균형을 맞춥니다 — 일상 대화와 문서 작성에 적합합니다
  • 높은 temperature (0.9 – 2.0): 출력이 더 무작위하고 창의적입니다 — 창의적 글쓰기와 브레인스토밍에 적합합니다

권장 설정:

시나리오권장 값
코드 생성0 – 0.2
기술 문서0.3 – 0.5
일상 대화0.6 – 0.8
창의적 글쓰기0.8 – 1.2
브레인스토밍1.0 – 1.5

max_tokens

속성
범위1 – (모델 한계)
기본값4096
전역 제어

목적: 단일 응답에서 모델 답변의 최대 길이를 제한합니다 (토큰 단위 — 한국어/중국어 문자 1자 약 1–2 토큰, 영어 단어 1개 약 1 토큰).

  • 답변이 중간에 잘리며 "최대 길이 도달" 메시지가 표시되면 max_tokens가 너무 낮게 설정된 것입니다
  • 매우 높은 값을 설정해도 모델이 항상 긴 응답을 생성하는 것은 아닙니다 — 모델은 답변이 완성되었다고 판단하면 자연스럽게 멈춥니다
  • 모델마다 한계가 다르며, 모델의 최대값을 초과하는 값은 자동으로 조정됩니다

주요 모델 출력 한계:

모델최대 출력 토큰
GPT-4o16,384
GPT-565,536
Claude Sonnet 4.565,536
Claude Haiku 4.565,536
Gemini 3 Flash65,536
Qwen3 Max65,536
DeepSeek V38,192

top_p

속성
범위0 – 1
기본값1.0
전역 제어

목적: 뉴클리어스 샘플링(Nucleus Sampling)은 무작위성을 제어하는 또 다른 방법입니다. 각 토큰을 생성할 때 모델은 누적 확률이 top_p에 도달하는 후보들 중에서만 샘플링합니다.

  • top_p = 1.0: 모든 후보 토큰을 고려합니다 (필터링 없음)
  • top_p = 0.9: 확률 질량의 90%를 차지하는 가장 높은 확률의 토큰들에서만 샘플링합니다
  • top_p = 0.1: 확률 질량의 10%를 차지하는 가장 높은 확률의 토큰들에서만 샘플링합니다 — 출력이 매우 결정적입니다

참고: 일반적으로 temperaturetop_p 중 하나만 조정하는 것이 권장됩니다. 두 값을 동시에 크게 수정하면 예측할 수 없는 효과가 나타날 수 있습니다.

추론 예산 (Thinking Budget)

속성
옵션none / low / medium / high
기본값low
전역 제어

목적: 추론 모델(Claude Sonnet 4.5, Gemini 3 Flash, DeepSeek R1 등 추론 지원 모델)이 응답하기 전에 수행하는 "사고"의 깊이를 제어합니다.

단계설명사용 사례
none추론 비활성화; 모델이 직접 답변간단한 Q&A, 가벼운 대화
low가벼운 사고일상 작업 — 속도와 품질의 균형
medium중간 사고어느 정도 추론이 필요한 복잡한 문제
high최대 토큰 예산으로 깊은 사고수학 증명, 복잡한 코드, 심층 분석

추론 예산은 reasoning: true로 표시된 모델에만 적용됩니다. 추론을 지원하지 않는 모델에서는 이 설정이 무시됩니다.

reasoning_effort

이 파라미터는 OpenAI의 o 시리즈 모델(예: o1, o3, o4-mini)에만 해당됩니다.

속성
옵션low / medium / high
기본값medium
  • low: 빠른 응답, 간단한 질문에 적합
  • medium: 균형 모드
  • high: 깊은 추론, 복잡한 작업에 적합

도구 최대 횟수 (Tool Max Turns)

속성
범위1 – 50
기본값5
전역 제어

목적: Agent 모드에서 MCP 도구 호출 반복 횟수의 최대값을 제한합니다. 모델이 단일 대화 내에서 도구를 연속적으로 호출할 때 이 한계에 도달하면 강제로 중단하고 현재 결과를 반환합니다.

설정 참조

전역 모델 파라미터

파라미터타입기본값범위활성화/비활성화
temperature숫자0.70 – 2기본 활성화
topP숫자1.00 – 1기본 비활성화
maxTokens숫자40961 – (모델 한계)기본 비활성화
defaultThinkingBudget열거형lownone/low/medium/high항상 적용
toolMaxTurns숫자51 – 50항상 적용

프로바이더 기본 파라미터

파라미터타입시스템 기본값설명
temperature숫자0.7프로바이더 수준 기본 temperature
topP숫자1프로바이더 수준 기본 top_p
maxTokens숫자4096프로바이더 수준 기본 최대 출력
stream불리언true스트리밍 사용 여부
presencePenalty숫자(미설정)존재 페널티 (–2 ~ 2)
frequencyPenalty숫자(미설정)빈도 페널티 (–2 ~ 2)
stop문자열 배열(미설정)중지 시퀀스
seed숫자(미설정)랜덤 시드 (재현 가능한 출력용)
jsonMode불리언falseJSON 형식 출력 강제 여부

프로바이더별 기본 파라미터 차이

프로바이더 템플릿마다 다른 기본 파라미터를 제공합니다:

프로바이더temperaturemaxTokenstopP기타
OpenAI0.74,096----
Anthropic0.765,536----
Google Gemini0.765,5360.95--
시스템 기본0.74,0961stream: true

동작 설명

파라미터 우선순위

동일한 파라미터가 여러 단계에서 설정된 경우 우선순위는 다음과 같습니다:

  1. 세션 수준 파라미터 (채팅 중 임시 조정) — 최고 우선순위
  2. 전역 모델 파라미터 (설정 페이지에서 설정하고 "활성화"로 표시된 것)
  3. 프로바이더 기본 파라미터 (프로바이더 설정의 defaultSettings)
  4. 시스템 기본값 (temperature: 0.7, topP: 1, maxTokens: 4096)

"비활성화"로 표시된 전역 모델 파라미터는 프로바이더 기본값을 재정의하지 않습니다.

모델과 파라미터 호환성

모든 파라미터가 모든 모델에서 지원되는 것은 아닙니다:

파라미터OpenAIAnthropicGemini로컬 모델
temperature지원지원지원지원
maxTokens지원지원지원지원
topP지원지원지원지원
presencePenalty지원미지원미지원부분 지원
frequencyPenalty지원미지원미지원부분 지원
seed지원미지원미지원부분 지원
thinking부분 지원 (o 시리즈)지원지원미지원

지원하지 않는 파라미터는 요청이 전송되기 전에 Transformer가 자동으로 제거하므로 오류가 발생하지 않습니다.

Transformer가 파라미터에 미치는 영향

Elftia의 Transformer 시스템은 요청을 보내기 전에 파라미터를 적용합니다:

Transformer파라미터 처리
anthropicmax_tokens를 Anthropic의 필드 형식으로 매핑
gemini파라미터를 Gemini의 generationConfig 형식으로 변환
samplingtemperaturetop_p 등 샘플링 파라미터 정규화
maxtoken특정 max_tokens 값 강제 설정 (사용자 설정 재정의)
maxcompletiontokensmax_tokensmax_completion_tokens로 변환 (일부 모델 필요)
reasoning추론 모델의 reasoning_content 필드 처리
forcereasoning추론 모드 강제 활성화 (사용자의 thinking budget 설정 무시)

모델 라우팅

Elftia는 작업 유형별로 다른 모델을 설정하는 것을 지원합니다:

라우팅 역할설명설정 위치
기본 모델기본 채팅 모델채팅 UI의 모델 선택
백그라운드 모델경량 작업에 사용 (요약, 제목 생성 등)설정 → Agent 기본 모델
비전 모델이미지가 포함된 메시지 처리 (기본 모델이 비전을 지원하지 않을 때)설정 → Agent 기본 모델
추론 모델깊은 사고가 필요한 작업thinking budget 단계로 제어

프로바이더 따르기 (Follow Provider): 이 옵션을 활성화하면 백그라운드 모델과 비전 모델이 현재 기본 모델과 같은 프로바이더의 해당 모델을 자동으로 사용합니다. 예를 들어, 기본 모델로 Zhipu의 GLM-5를 사용하면 백그라운드 모델은 자동으로 GLM-4.5 Air를, 비전 모델은 GLM-4.6V를 사용합니다.

문제 해결

문제가능한 원인해결책
응답이 잘림max_tokens가 너무 낮게 설정됨max_tokens 값을 늘리거나, 전역 파라미터에서 활성화하고 더 큰 값을 설정합니다
응답이 너무 무작위하거나 관련 없음temperature가 너무 높음temperature를 낮춥니다 (0.3–0.7 권장)
응답이 너무 경직되거나 반복적임temperature가 너무 낮음temperature를 약간 높입니다 (0.5–0.8 권장)
추론 모델이 사고 과정을 표시하지 않음thinking budget이 none으로 설정됨defaultThinkingBudgetlow 이상으로 설정합니다
추론 모델이 너무 오래 생각함thinking budget이 high로 설정됨medium 또는 low로 낮춥니다
파라미터 설정이 적용되지 않음더 높은 우선순위 설정에 의해 재정의됨세션 수준 파라미터가 재정의하는지 확인하고 전역 파라미터 활성화 스위치가 켜져 있는지 확인합니다
요청에서 파라미터 오류 반환모델이 특정 파라미터를 지원하지 않음모델과 파라미터 호환성을 확인하고 호환되지 않는 파라미터를 비활성화합니다
도구 호출이 대화 중간에 중단됨toolMaxTurns 한계 도달toolMaxTurns 값을 늘립니다 (API 비용이 증가할 수 있음에 주의)
프로바이더 간 성능 차이가 큼프로바이더 기본 파라미터가 다름전역 파라미터를 활성화하고 주요 파라미터를 일관된 값으로 설정합니다

관련 페이지