모델 파라미터
모델 파라미터는 LLM이 텍스트를 생성하는 방식을 제어합니다 — 창의성, 출력 길이, 샘플링 전략 등이 이에 해당합니다. 파라미터를 적절히 조정하면 AI 출력 품질을 크게 향상시키고 사용 목적에 더 잘 맞출 수 있습니다.
사용 시기
- 기본 출력이 너무 무작위하거나 너무 경직되어 창의성을 조정하고 싶을 때
- 응답이 자주 잘리고 출력 길이 제한을 늘려야 할 때
- 추론 모델을 사용 중이고 사고 깊이를 제어하고 싶을 때
- 시나리오별로 다른 파라미터 조합이 필요할 때 (창의적 글쓰기 대 코드 생성)
파라미터 설정 위치
Elftia는 여러 단계의 파라미터 설정을 제공하며, 다음과 같은 우선순위를 따릅니다 (높음에서 낮음 순):
세션 수준 파라미터 (채팅 창에서 임시 조정)
|
v 재정의
전역 모델 파라미터 (설정 → 모델 파라미터)
|
v 재정의
프로바이더 기본 파라미터 (프로바이더 설정의 defaultSettings)
|
v 재정의
시스템 기본값
전역 모델 파라미터
- 설정 → 모델 파라미터를 엽니다
- 각 파라미터 값을 조정합니다
- 각 파라미터 옆의 활성화/비활성화 토글로 적용 여부를 제어합니다
세션 수준 파라미터
- 채팅 UI에서 모델 선택 영역 옆의 파라미터 버튼을 클릭합니다
- 현재 세션의 파라미터를 임시로 조정합니다
- 이 조정은 현재 세션에만 적용됩니다
핵심 파라미터 설명
temperature
| 속성 | 값 |
|---|---|
| 범위 | 0 – 2 |
| 기본값 | 0.7 |
| 전역 제어 | 예 |
목적: 출력의 무작위성과 창의성을 제어합니다.
- 낮은 temperature (0 – 0.3): 출력이 더 결정적이고 일관됩니다 — 코드 생성, 사실 Q&A, 데이터 추출 등 정밀함이 요구되는 시나리오에 적합합니다
- 중간 temperature (0.4 – 0.8): 창의성과 일관성의 균형을 맞춥니다 — 일상 대화와 문서 작성에 적합합니다
- 높은 temperature (0.9 – 2.0): 출력이 더 무작위하고 창의적입니다 — 창의적 글쓰기와 브레인스토밍에 적합합니다
권장 설정:
| 시나리오 | 권장 값 |
|---|---|
| 코드 생성 | 0 – 0.2 |
| 기술 문서 | 0.3 – 0.5 |
| 일상 대화 | 0.6 – 0.8 |
| 창의적 글쓰기 | 0.8 – 1.2 |
| 브레인스토밍 | 1.0 – 1.5 |
max_tokens
| 속성 | 값 |
|---|---|
| 범위 | 1 – (모델 한계) |
| 기본값 | 4096 |
| 전역 제어 | 예 |
목적: 단일 응답에서 모델 답변의 최대 길이를 제한합니다 (토큰 단위 — 한국어/중국어 문자 1자 약 1–2 토큰, 영어 단어 1개 약 1 토큰).
- 답변이 중간에 잘리며 "최대 길이 도달" 메시지가 표시되면
max_tokens가 너무 낮게 설정된 것입니다 - 매우 높은 값을 설정해도 모델이 항상 긴 응답을 생성하는 것은 아닙니다 — 모델은 답변이 완성되었다고 판단하면 자연스럽게 멈춥니다
- 모델마다 한계가 다르며, 모델의 최대값을 초과하는 값은 자동으로 조정됩니다
주요 모델 출력 한계:
| 모델 | 최대 출력 토큰 |
|---|---|
| GPT-4o | 16,384 |
| GPT-5 | 65,536 |
| Claude Sonnet 4.5 | 65,536 |
| Claude Haiku 4.5 | 65,536 |
| Gemini 3 Flash | 65,536 |
| Qwen3 Max | 65,536 |
| DeepSeek V3 | 8,192 |
top_p
| 속성 | 값 |
|---|---|
| 범위 | 0 – 1 |
| 기본값 | 1.0 |
| 전역 제어 | 예 |
목적: 뉴클리어스 샘플링(Nucleus Sampling)은 무작위성을 제어하는 또 다른 방법입니다. 각 토큰을 생성할 때 모델은 누적 확률이 top_p에 도달하는 후보들 중에서만 샘플링합니다.
- top_p = 1.0: 모든 후보 토큰을 고려합니다 (필터링 없음)
- top_p = 0.9: 확률 질량의 90%를 차지하는 가장 높은 확률의 토큰들에서만 샘플링합니다
- top_p = 0.1: 확률 질량의 10%를 차지하는 가장 높은 확률의 토큰들에서만 샘플링합니다 — 출력이 매우 결정적입니다
참고: 일반적으로 temperature와 top_p 중 하나만 조정하는 것이 권장됩니다. 두 값을 동시에 크게 수정하면 예측할 수 없는 효과가 나타날 수 있습니다.
추론 예산 (Thinking Budget)
| 속성 | 값 |
|---|---|
| 옵션 | none / low / medium / high |
| 기본값 | low |
| 전역 제어 | 예 |
목적: 추론 모델(Claude Sonnet 4.5, Gemini 3 Flash, DeepSeek R1 등 추론 지원 모델)이 응답하기 전에 수행하는 "사고"의 깊이를 제어합니다.
| 단계 | 설명 | 사용 사례 |
|---|---|---|
| none | 추론 비활성화; 모델이 직접 답변 | 간단한 Q&A, 가벼운 대화 |
| low | 가벼운 사고 | 일상 작업 — 속도와 품질의 균형 |
| medium | 중간 사고 | 어느 정도 추론이 필요한 복잡한 문제 |
| high | 최대 토큰 예산으로 깊은 사고 | 수학 증명, 복잡한 코드, 심층 분석 |
추론 예산은 reasoning: true로 표시된 모델에만 적용됩니다. 추론을 지원하지 않는 모델에서는 이 설정이 무시됩니다.
reasoning_effort
이 파라미터는 OpenAI의 o 시리즈 모델(예: o1, o3, o4-mini)에만 해당됩니다.
| 속성 | 값 |
|---|---|
| 옵션 | low / medium / high |
| 기본값 | medium |
- low: 빠른 응답, 간단한 질문에 적합
- medium: 균형 모드
- high: 깊은 추론, 복잡한 작업에 적합
도구 최대 횟수 (Tool Max Turns)
| 속성 | 값 |
|---|---|
| 범위 | 1 – 50 |
| 기본값 | 5 |
| 전역 제어 | 예 |
목적: Agent 모드에서 MCP 도구 호출 반복 횟수의 최대값을 제한합니다. 모델이 단일 대화 내에서 도구를 연속적으로 호출할 때 이 한계에 도달하면 강제로 중단하고 현재 결과를 반환합니다.
설정 참조
전역 모델 파라미터
| 파라미터 | 타입 | 기본값 | 범위 | 활성화/비활성화 |
|---|---|---|---|---|
| temperature | 숫자 | 0.7 | 0 – 2 | 기본 활성화 |
| topP | 숫자 | 1.0 | 0 – 1 | 기본 비활성화 |
| maxTokens | 숫자 | 4096 | 1 – (모델 한계) | 기본 비활성화 |
| defaultThinkingBudget | 열거형 | low | none/low/medium/high | 항상 적용 |
| toolMaxTurns | 숫자 | 5 | 1 – 50 | 항상 적용 |
프로바이더 기본 파라미터
| 파라미터 | 타입 | 시스템 기본값 | 설명 |
|---|---|---|---|
| temperature | 숫자 | 0.7 | 프로바이더 수준 기본 temperature |
| topP | 숫자 | 1 | 프로바이더 수준 기본 top_p |
| maxTokens | 숫자 | 4096 | 프로바이더 수준 기본 최대 출력 |
| stream | 불리언 | true | 스트리밍 사용 여부 |
| presencePenalty | 숫자 | (미설정) | 존재 페널티 (–2 ~ 2) |
| frequencyPenalty | 숫자 | (미설정) | 빈도 페널티 (–2 ~ 2) |
| stop | 문자열 배열 | (미설정) | 중지 시퀀스 |
| seed | 숫자 | (미설정) | 랜덤 시드 (재현 가능한 출력용) |
| jsonMode | 불리언 | false | JSON 형식 출력 강제 여부 |
프로바이더별 기본 파라미터 차이
프로바이더 템플릿마다 다른 기본 파라미터를 제공합니다:
| 프로바이더 | temperature | maxTokens | topP | 기타 |
|---|---|---|---|---|
| OpenAI | 0.7 | 4,096 | -- | -- |
| Anthropic | 0.7 | 65,536 | -- | -- |
| Google Gemini | 0.7 | 65,536 | 0.95 | -- |
| 시스템 기본 | 0.7 | 4,096 | 1 | stream: true |
동작 설명
파라미터 우선순위
동일한 파라미터가 여러 단계에서 설정된 경우 우선순위는 다음과 같습니다:
- 세션 수준 파라미터 (채팅 중 임시 조정) — 최고 우선순위
- 전역 모델 파라미터 (설정 페이지에서 설정하고 "활성화"로 표시된 것)
- 프로바이더 기본 파라미터 (프로바이더 설정의
defaultSettings) - 시스템 기본값 (
temperature: 0.7, topP: 1, maxTokens: 4096)
"비활성화"로 표시된 전역 모델 파라미터는 프로바이더 기본값을 재정의하지 않습니다.
모델과 파라미터 호환성
모든 파라미터가 모든 모델에서 지원되는 것은 아닙니다:
| 파라미터 | OpenAI | Anthropic | Gemini | 로컬 모델 |
|---|---|---|---|---|
| temperature | 지원 | 지원 | 지원 | 지원 |
| maxTokens | 지원 | 지원 | 지원 | 지원 |
| topP | 지원 | 지원 | 지원 | 지원 |
| presencePenalty | 지원 | 미지원 | 미지원 | 부분 지원 |
| frequencyPenalty | 지원 | 미지원 | 미지원 | 부분 지원 |
| seed | 지원 | 미지원 | 미지원 | 부분 지원 |
| thinking | 부분 지원 (o 시리즈) | 지원 | 지원 | 미지원 |
지원하지 않는 파라미터는 요청이 전송되기 전에 Transformer가 자동으로 제거하므로 오류가 발생하지 않습니다.
Transformer가 파라미터에 미치는 영향
Elftia의 Transformer 시스템은 요청을 보내기 전에 파라미터를 적용합니다:
| Transformer | 파라미터 처리 |
|---|---|
anthropic | max_tokens를 Anthropic의 필드 형식으로 매핑 |
gemini | 파라미터를 Gemini의 generationConfig 형식으로 변환 |
sampling | temperature 및 top_p 등 샘플링 파라미터 정규화 |
maxtoken | 특정 max_tokens 값 강제 설정 (사용자 설정 재정의) |
maxcompletiontokens | max_tokens를 max_completion_tokens로 변환 (일부 모델 필요) |
reasoning | 추론 모델의 reasoning_content 필드 처리 |
forcereasoning | 추론 모드 강제 활성화 (사용자의 thinking budget 설정 무시) |
모델 라우팅
Elftia는 작업 유형별로 다른 모델을 설정하는 것을 지원합니다:
| 라우팅 역할 | 설명 | 설정 위치 |
|---|---|---|
| 기본 모델 | 기본 채팅 모델 | 채팅 UI의 모델 선택 |
| 백그라운드 모델 | 경량 작업에 사용 (요약, 제목 생성 등) | 설정 → Agent 기본 모델 |
| 비전 모델 | 이미지가 포함된 메시지 처리 (기본 모델이 비전을 지원하지 않을 때) | 설정 → Agent 기본 모델 |
| 추론 모델 | 깊은 사고가 필요한 작업 | thinking budget 단계로 제어 |
프로바이더 따르기 (Follow Provider): 이 옵션을 활성화하면 백그라운드 모델과 비전 모델이 현재 기본 모델과 같은 프로바이더의 해당 모델을 자동으로 사용합니다. 예를 들어, 기본 모델로 Zhipu의 GLM-5를 사용하면 백그라운드 모델은 자동으로 GLM-4.5 Air를, 비전 모델은 GLM-4.6V를 사용합니다.
문제 해결
| 문제 | 가능한 원인 | 해결책 |
|---|---|---|
| 응답이 잘림 | max_tokens가 너무 낮게 설정됨 | max_tokens 값을 늘리거나, 전역 파라미터에서 활성화하고 더 큰 값을 설정합니다 |
| 응답이 너무 무작위하거나 관련 없음 | temperature가 너무 높음 | temperature를 낮춥니다 (0.3–0.7 권장) |
| 응답이 너무 경직되거나 반복적임 | temperature가 너무 낮음 | temperature를 약간 높입니다 (0.5–0.8 권장) |
| 추론 모델이 사고 과정을 표시하지 않음 | thinking budget이 none으로 설정됨 | defaultThinkingBudget을 low 이상으로 설정합니다 |
| 추론 모델이 너무 오래 생각함 | thinking budget이 high로 설정됨 | medium 또는 low로 낮춥니다 |
| 파라미터 설정이 적용되지 않음 | 더 높은 우선순위 설정에 의해 재정의됨 | 세션 수준 파라미터가 재정의하는지 확인하고 전역 파라미터 활성화 스위치가 켜져 있는지 확인합니다 |
| 요청에서 파라미터 오류 반환 | 모델이 특정 파라미터를 지원하지 않음 | 모델과 파라미터 호환성을 확인하고 호환되지 않는 파라미터를 비활성화합니다 |
| 도구 호출이 대화 중간에 중단됨 | toolMaxTurns 한계 도달 | toolMaxTurns 값을 늘립니다 (API 비용이 증가할 수 있음에 주의) |
| 프로바이더 간 성능 차이가 큼 | 프로바이더 기본 파라미터가 다름 | 전역 파라미터를 활성화하고 주요 파라미터를 일관된 값으로 설정합니다 |
관련 페이지
- LLM 프로바이더 개요 - 프로바이더 시스템과 포맷 트랜스포머 이해하기
- 프로바이더 추가 - 프로바이더 설정 시 기본 파라미터 설정
- API 키 풀 - 다중 키 관리 및 로드 밸런싱
- 커스텀 엔드포인트 - 로컬 모델의 파라미터 호환성 참고 사항