AMLR (AICLUDE Multi LLM Router)

업무마다 다른 모델, 운영은 하나로.

빠르게 읽는 모델, 깊이 이해하는 모델, 답변을 잘 쓰는 모델. AMLR로 여러 LLM을 연결하고 파이프라인의 각 단계에 맞는 모델을 선택하세요. 실제 측정 결과와 로컬 설치 정보를 한곳에서 비교할 수 있습니다.

모델 목록 확인일 ·

각 단계에 맞춰 선택하세요AMLR
  1. 01

    입력

    첨부와 요청을 읽고 입력을 정리합니다.

  2. 02

    이해

    의도와 맥락을 파악하고 실행 방향을 정합니다.

  3. 03

    생성

    업무에 필요한 답변을 작성합니다.

  4. 04

    검증

    답변이 요구사항을 충족하는지 확인합니다.

OpenAIAnthropicGooglexAI
13
AMLR 관리형 모델
39
Platform 등록 LLM
21
로컬 설치 모델
468
벤치마크 완료 실행

모델을 바꾸는 일이, 운영을 바꾸는 일이 되지 않도록.

하나의 연결 방식

OpenAI 호환 API로 여러 제공사의 모델을 연결합니다. 관리형 AMLR 키로 접근을 관리해 모델별 연동 부담을 줄입니다.

단계마다 다른 선택

모든 단계에 같은 모델을 쓸 필요는 없습니다. 입력·이해·생성·검증에서 필요한 품질과 속도를 비교해 선택하세요.

사용량과 예산을 함께

Console에서 AMLR 키별 일간·월간 예산과 초과 시 정책을 설정합니다. 호출 사용량을 확인하며 운영 비용을 관리할 수 있습니다.

측정 결과로 선택하기

어떤 모델을, 어느 단계에 쓸까요?

측정 보고서 ·

같은 파이프라인 과제를 9개 모델에 실행했습니다. 업무 점수, 입력·출력 100만 토큰당 단가, 응답 시간을 함께 비교하세요.

01

지능 · 업무 점수

요청을 이해하고 답변을 만들고 검증하는 능력을 봅니다. 선택한 단계의 평가 항목을 얼마나 충족했는지 100점 만점으로 표시합니다.

02

가격 · 100만 토큰당 단가

모델별 입력·출력 단가를 각각 USD / 1M tokens로 비교합니다. 실제 비용은 사용한 입력·출력 토큰 수에 따라 달라집니다.

03

속도 · 평균 응답 시간

실제 시험에서 단계별 호출을 마치는 데 걸린 시간입니다. 짧을수록 빠르며 선택한 단계의 측정 결과를 보여줍니다.

100점부터 0점까지, 무엇을 뜻하나요?

과제별 평가 항목 충족 비율을 0~100점으로 환산합니다. 부분 점수를 포함하며 전체 평균은 입력·이해·생성·검증에 같은 비중을 줍니다.

100
모든 평가 항목 충족
80
평균 충족도 80%
60
평균 충족도 60%
40
평균 충족도 40%
20
평균 충족도 20%
0
평가 항목 충족 점수 없음

예: 같은 비중의 항목 5개 중 4개를 충족하면 80점입니다. 점수는 이번 시험 범위에 대한 값이며 지능 전체나 모든 업무의 성공률을 뜻하지 않습니다.

가격 단위: USD / 1M tokens

1M은 100만 토큰입니다. 입력과 출력 단가는 각각 100만 토큰 기준으로 표시합니다.

Claude Fable 5.1

지능 / 100
97.2
응답 시간
21.1 초
입력 단가USD / 1M tokens
$10.00
출력 단가USD / 1M tokens
$50.00

Claude Sonnet 5

지능 / 100
97.0
응답 시간
11.7 초
입력 단가USD / 1M tokens
$2.00
출력 단가USD / 1M tokens
$10.00

GPT-5.6 Luna

지능 / 100
96.2
응답 시간
6.4 초
입력 단가USD / 1M tokens
$0.20
출력 단가USD / 1M tokens
$1.20

GPT-6 Astra

지능 / 100
96.2
응답 시간
13.8 초
입력 단가USD / 1M tokens
$10.00
출력 단가USD / 1M tokens
$50.00

GPT-5.6 Terra

지능 / 100
95.9
응답 시간
10.2 초
입력 단가USD / 1M tokens
$2.00
출력 단가USD / 1M tokens
$12.00

Claude Opus 5

지능 / 100
95.2
응답 시간
26.4 초
입력 단가USD / 1M tokens
$5.00
출력 단가USD / 1M tokens
$25.00

GPT-5.6 Sol

지능 / 100
95.1
응답 시간
10.3 초
입력 단가USD / 1M tokens
$4.00
출력 단가USD / 1M tokens
$20.00

Gemini 3.8 Flash

지능 / 100
94.0
응답 시간
4.7 초
입력 단가USD / 1M tokens
$0.75
출력 단가USD / 1M tokens
$3.75

Gemini 3.1 Flash-Lite

지능 / 100
92.6
응답 시간
2.0 초
입력 단가USD / 1M tokens
$0.25
출력 단가USD / 1M tokens
$1.50

가격은 Platform에 등록된 모델 API 표준 단가입니다. AMLR 요금제, 세금, 캐시·배치 할인 및 장문 구간 요율은 포함하지 않습니다. · 단가 확인일 2026년 9월 16일

점수는 평가 항목 충족도를 100점으로 환산한 값입니다. 표본이 작아 1~2점 차이로 우열을 단정할 수 없습니다.

시험 조건과 해석

AICLUDE 내부 파이프라인 벤치마크 1차 결과입니다. 입력 12개, 이해 12개, 생성 10개, 검증 18개 과제를 모델마다 실행했고, 부분 점수를 포함한 평가 항목 충족 비율을 평균했습니다. 전체 평균 점수는 4개 단계에 같은 비중을 주며, 전체 평균 지연은 완료 실행 전체의 평균입니다. 지연은 단계별 호출 시간이며 전체 파이프라인 수행 시간과 다릅니다.

사용 비용 = (입력 토큰 × 입력 단가 + 출력 토큰 × 출력 단가) ÷ 1,000,000. 입력·출력 단가는 각각 USD / 1M tokens 기준입니다.

판정 모델: claude-fable-5-1

완료 실행 468건을 집계했습니다. 선택한 배치의 미완료·실패 실행 11건과 교체된 이전 배치는 점수에서 제외했습니다.

검증 단계는 대부분 높은 점수에 모여 모델 간 차이가 잘 드러나지 않습니다. 생성 단계의 토큰 한도도 점수에 영향을 줍니다. 외부 공인 평가나 로컬 모델 성능 측정으로 볼 수 없으며, 실제 업무 데이터로 추가 검증하는 것을 권합니다.

집계 데이터 내려받기 (JSON)

Cloud models

Platform의 LLM 목록을 한눈에.

관리형 AMLR 호출 대상과 다른 연결 방식의 모델을 구분해 표시합니다. 등록 상태는 계정별 사용 가능 여부나 모든 모델의 호출 성공을 보장하지 않습니다.

13개 모델 표시

AnthropicAMLR 관리형

Claude Fable 5.1

claude-fable-5-1

컨텍스트
1M
최대 출력
128K

USD / 100만 토큰 · Platform 표준 단가

입력
$10.00
출력
$50.00
제공사 문서
AnthropicAMLR 관리형

Claude Opus 5

claude-opus-5

컨텍스트
1M
최대 출력
128K

USD / 100만 토큰 · Platform 표준 단가

입력
$5.00
출력
$25.00
제공사 문서
AnthropicAMLR 관리형

Claude Sonnet 5

claude-sonnet-5

컨텍스트
1M
최대 출력
128K

USD / 100만 토큰 · Platform 표준 단가

입력
$2.00
출력
$10.00
제공사 문서
GoogleAMLR 관리형

Gemini 3.1 Flash-Lite

gemini-3.1-flash-lite

컨텍스트
1M
최대 출력
미등록

USD / 100만 토큰 · Platform 표준 단가

입력
$0.25
출력
$1.50
제공사 문서
GoogleAMLR 관리형

Gemini 3.8 Flash

gemini-3.8-flash

컨텍스트
1M
최대 출력
미등록

USD / 100만 토큰 · Platform 표준 단가

입력
$0.75
출력
$3.75
제공사 문서
OpenAIAMLR 관리형

GPT-5.6 Luna

gpt-5.6-luna

컨텍스트
미등록
최대 출력
미등록

USD / 100만 토큰 · Platform 표준 단가

입력
$0.20
출력
$1.20
제공사 문서
OpenAIAMLR 관리형

GPT-5.6 Sol

gpt-5.6-sol

컨텍스트
미등록
최대 출력
미등록

USD / 100만 토큰 · Platform 표준 단가

입력
$4.00
출력
$20.00
제공사 문서
OpenAIAMLR 관리형

GPT-5.6 Terra

gpt-5.6-terra

컨텍스트
미등록
최대 출력
미등록

USD / 100만 토큰 · Platform 표준 단가

입력
$2.00
출력
$12.00
제공사 문서
OpenAIAMLR 관리형

GPT-6 Astra

gpt-6-astra

컨텍스트
1.05M
최대 출력
128K

USD / 100만 토큰 · Platform 표준 단가

입력
$10.00
출력
$50.00
제공사 문서
xAIAMLR 관리형

Grok 4

grok-4

컨텍스트
256K
최대 출력
32K

USD / 100만 토큰 · Platform 표준 단가

입력
$3.00
출력
$15.00
제공사 문서
xAIAMLR 관리형

Grok 4.1 Fast

grok-4.1-fast

컨텍스트
2000000
최대 출력
131072

USD / 100만 토큰 · Platform 표준 단가

입력
$0.20
출력
$0.50
xAIAMLR 관리형

Grok 4 Fast

grok-4-fast

컨텍스트
2M
최대 출력
32K

USD / 100만 토큰 · Platform 표준 단가

입력
$0.20
출력
$0.50
제공사 문서
xAIAMLR 관리형

Grok Code Fast 1

grok-code-fast-1

컨텍스트
131072
최대 출력
131072

USD / 100만 토큰 · Platform 표준 단가

입력
$0.20
출력
$1.50

추가 연동 확인: Platform에는 등록되어 있지만 현재 관리형 AMLR 호출 대상에는 포함되지 않습니다.

Local models

내 장비에 둘 모델도 비교하세요.

CAP·CAS 로컬 실행용 설치 카탈로그입니다. 모델을 펼치면 양자화별 파일 크기, 8K 문맥 기준 예상 VRAM과 최소 시스템 RAM, 실행 엔진을 확인할 수 있습니다.

설치 카탈로그 갱신일 · 2026년 9월 9일

21개 모델 표시

Mi:dm 2.0 Base 11.5B3개 설치 변형예상 VRAM 최소 9 GB
라이선스
mit · 라이선스 확인
컨텍스트
32,768
Mi:dm 2.0 Base 11.5B · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
Q4_K_M7.03 GB9 GB16 GBllama.cpp권장
Q5_K_M8.22 GB10.5 GB16 GBllama.cppGPU 권장
Q8_012.27 GB14.5 GB24 GBllama.cppGPU 권장
모델 원본·이용 조건
Gemma 4 E2B Instruct21개 설치 변형예상 VRAM 최소 3.3 GB
라이선스
apache-2.0 · 라이선스 확인
컨텍스트
262,144
Gemma 4 E2B Instruct · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
BF169.31 GB10.6 GB13 GBllama.cppGPU 권장
IQ4_NL3.04 GB4.1 GB7 GBllama.cpp권장
IQ4_XS2.98 GB4 GB6 GBllama.cpp권장
Q3_K_M2.54 GB3.5 GB6 GBllama.cpp권장
Q3_K_S2.45 GB3.4 GB6 GBllama.cpp권장
Q4_03.04 GB4.1 GB7 GBllama.cpp권장
Q4_13.15 GB4.2 GB7 GBllama.cpp권장
Q4_K_M3.11 GB4.1 GB7 GBllama.cpp권장
Q4_K_S3.04 GB4.1 GB7 GBllama.cpp권장
Q5_K_M3.36 GB4.4 GB7 GBllama.cpp권장
Q5_K_S3.32 GB4.3 GB7 GBllama.cpp권장
Q6_K4.5 GB5.6 GB8 GBllama.cpp권장
Q8_05.05 GB6.2 GB9 GBllama.cpp권장
UD-IQ2_M2.29 GB3.3 GB6 GBllama.cpp권장
UD-IQ3_XXS2.37 GB3.3 GB6 GBllama.cpp권장
UD-Q2_K_XL2.4 GB3.4 GB6 GBllama.cpp권장
UD-Q3_K_XL2.92 GB3.9 GB6 GBllama.cpp권장
UD-Q4_K_XL3.18 GB4.2 GB7 GBllama.cpp권장
UD-Q5_K_XL4.29 GB5.4 GB8 GBllama.cpp권장
UD-Q6_K_XL4.71 GB5.8 GB8 GBllama.cpp권장
UD-Q8_K_XL5.28 GB6.4 GB9 GBllama.cpp권장
모델 원본·이용 조건
Gemma 4 E4B Instruct21개 설치 변형예상 VRAM 최소 4.7 GB
라이선스
apache-2.0 · 라이선스 확인
컨텍스트
262,144
Gemma 4 E4B Instruct · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
BF1615.05 GB16.8 GB19 GBllama.cppGPU 권장
IQ4_NL4.84 GB6 GB8 GBllama.cpp권장
IQ4_XS4.72 GB5.9 GB8 GBllama.cpp권장
Q3_K_M4.06 GB5.2 GB8 GBllama.cpp권장
Q3_K_S3.86 GB5 GB7 GBllama.cpp권장
Q4_04.84 GB6 GB8 GBllama.cpp권장
Q4_15.07 GB6.3 GB9 GBllama.cpp권장
Q4_K_M4.98 GB6.2 GB8 GBllama.cpp권장
Q4_K_S4.84 GB6 GB8 GBllama.cpp권장
Q5_K_M5.48 GB6.7 GB9 GBllama.cpp권장
Q5_K_S5.4 GB6.6 GB9 GBllama.cpp권장
Q6_K7.07 GB8.4 GB11 GBllama.cpp권장
Q8_08.19 GB9.6 GB12 GBllama.cpp권장
UD-IQ2_M3.55 GB4.7 GB7 GBllama.cpp권장
UD-IQ3_XXS3.72 GB4.9 GB7 GBllama.cpp권장
UD-Q2_K_XL3.76 GB4.9 GB7 GBllama.cpp권장
UD-Q3_K_XL4.59 GB5.8 GB8 GBllama.cpp권장
UD-Q4_K_XL5.13 GB6.3 GB9 GBllama.cpp권장
UD-Q5_K_XL6.66 GB7.9 GB10 GBllama.cpp권장
UD-Q6_K_XL7.46 GB8.8 GB11 GBllama.cpp권장
UD-Q8_K_XL8.71 GB10.1 GB12 GBllama.cpp권장
모델 원본·이용 조건
Gemma 4 12B Instruct21개 설치 변형예상 VRAM 최소 6.1 GB
라이선스
apache-2.0 · 라이선스 확인
컨텍스트
262,144
Gemma 4 12B Instruct · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
BF1623.83 GB26.7 GB27 GBllama.cppGPU 권장
IQ4_NL6.72 GB8.7 GB9 GBllama.cpp권장
IQ4_XS6.38 GB8.4 GB9 GBllama.cpp권장
Q3_K_M5.69 GB7.7 GB8 GBllama.cpp권장
Q3_K_S5.14 GB7.1 GB8 GBllama.cpp권장
Q4_06.74 GB8.7 GB9 GBllama.cpp권장
Q4_17.4 GB9.4 GB10 GBllama.cpp권장
Q4_K_M7.12 GB9.2 GB10 GBllama.cpp권장
Q4_K_S6.76 GB8.8 GB9 GBllama.cpp권장
Q5_K_M8.41 GB10.5 GB11 GBllama.cppGPU 권장
Q5_K_S8.2 GB10.3 GB11 GBllama.cppGPU 권장
Q6_K9.79 GB11.9 GB12 GBllama.cppGPU 권장
Q8_012.67 GB15 GB15 GBllama.cppGPU 권장
UD-IQ2_M4.21 GB6.1 GB7 GBllama.cpp권장
UD-IQ3_XXS4.64 GB6.5 GB7 GBllama.cpp권장
UD-Q2_K_XL4.66 GB6.6 GB7 GBllama.cpp권장
UD-Q3_K_XL6.02 GB8 GB9 GBllama.cpp권장
UD-Q4_K_XL7.37 GB9.4 GB10 GBllama.cpp권장
UD-Q5_K_XL8.61 GB10.7 GB11 GBllama.cppGPU 권장
UD-Q6_K_XL10.69 GB12.9 GB13 GBllama.cppGPU 권장
UD-Q8_K_XL13.64 GB16 GB16 GBllama.cppGPU 권장
모델 원본·이용 조건
Gemma 4 26B (MoE A4B) Instruct20개 설치 변형예상 VRAM 최소 11.8 GB
라이선스
apache-2.0 · 라이선스 확인
컨텍스트
262,144
Gemma 4 26B (MoE A4B) Instruct · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
MXFP4_MOE16.55 GB18.7 GB20 GBllama.cpp권장
Q8_026.86 GB29.5 GB31 GBllama.cpp권장
UD-IQ2_M10.01 GB11.9 GB14 GBllama.cpp권장
UD-IQ2_XXS9.92 GB11.8 GB14 GBllama.cpp권장
UD-IQ3_S11.29 GB13.2 GB15 GBllama.cpp권장
UD-IQ3_XXS11.42 GB13.3 GB15 GBllama.cpp권장
UD-IQ4_NL13.61 GB15.6 GB17 GBllama.cpp권장
UD-IQ4_XS13.6 GB15.6 GB17 GBllama.cpp권장
UD-Q2_K_XL10.55 GB12.4 GB14 GBllama.cpp권장
UD-Q3_K_M12.73 GB14.7 GB16 GBllama.cpp권장
UD-Q3_K_XL12.91 GB14.9 GB17 GBllama.cpp권장
UD-Q4_K_M16.95 GB19.1 GB21 GBllama.cpp권장
UD-Q4_K_S16.49 GB18.7 GB20 GBllama.cpp권장
UD-Q4_K_XL17.01 GB19.2 GB21 GBllama.cpp권장
UD-Q5_K_M21.15 GB23.6 GB25 GBllama.cpp권장
UD-Q5_K_S18.85 GB21.1 GB23 GBllama.cpp권장
UD-Q5_K_XL21.22 GB23.6 GB25 GBllama.cpp권장
UD-Q6_K23.17 GB25.7 GB27 GBllama.cpp권장
UD-Q6_K_XL23.3 GB25.8 GB27 GBllama.cpp권장
UD-Q8_K_XL27.64 GB30.4 GB31 GBllama.cpp권장
모델 원본·이용 조건
Gemma 4 E2B Instruct Uncensored2개 설치 변형예상 VRAM 최소 4.5 GB
라이선스
apache-2.0 · 라이선스 확인
컨텍스트
262,144
Gemma 4 E2B Instruct Uncensored · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
Q4_K_M3.43 GB4.5 GB6 GBllama.cpp권장
Q8_04.97 GB6.1 GB7 GBllama.cpp권장
모델 원본·이용 조건
Gemma 4 E4B Uncensored (HauhauCS Aggressive)11개 설치 변형예상 VRAM 최소 5.6 GB
라이선스
gemma · 이용 조건 제한
컨텍스트
262,144
Gemma 4 E4B Uncensored (HauhauCS Aggressive) · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
IQ3_M4.71 GB5.9 GB8 GBllama.cpp권장
IQ4_XS5.07 GB6.3 GB9 GBllama.cpp권장
Q2_K_P4.43 GB5.6 GB8 GBllama.cpp권장
Q3_K_M4.85 GB6 GB8 GBllama.cpp권장
Q3_K_P4.88 GB6.1 GB8 GBllama.cpp권장
Q4_K_M5.34 GB6.6 GB9 GBllama.cpp권장
Q4_K_P5.37 GB6.6 GB9 GBllama.cpp권장
Q5_K_M5.76 GB7 GB9 GBllama.cpp권장
Q5_K_P5.81 GB7.1 GB9 GBllama.cpp권장
Q6_K_P6.25 GB7.5 GB10 GBllama.cpp권장
Q8_K_P8.13 GB9.5 GB12 GBllama.cpp권장
모델 원본·이용 조건
Gemma 4 E4B Instruct Uncensored2개 설치 변형예상 VRAM 최소 6.6 GB
라이선스
apache-2.0 · 라이선스 확인
컨텍스트
262,144
Gemma 4 E4B Instruct Uncensored · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
Q4_K_M5.34 GB6.6 GB8 GBllama.cpp권장
Q8_08.03 GB9.4 GB11 GBllama.cpp권장
모델 원본·이용 조건
Gemma 4 12B Instruct Uncensored2개 설치 변형예상 VRAM 최소 9.4 GB
라이선스
apache-2.0 · 라이선스 확인
컨텍스트
262,144
Gemma 4 12B Instruct Uncensored · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
Q4_K_M7.38 GB9.4 GB10 GBllama.cpp권장
Q8_012.67 GB15 GB15 GBllama.cppGPU 권장
모델 원본·이용 조건
Gemma 4 26B (MoE A4B) Instruct Uncensored2개 설치 변형예상 VRAM 최소 19 GB
라이선스
apache-2.0 · 라이선스 확인
컨텍스트
262,144
Gemma 4 26B (MoE A4B) Instruct Uncensored · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
Q4_K_M16.8 GB19 GB19 GBllama.cpp권장
Q8_026.86 GB29.5 GB29 GBllama.cpp권장
모델 원본·이용 조건
Mi:dm 2.0 Mini 2.3B3개 설치 변형예상 VRAM 최소 4 GB
라이선스
mit · 라이선스 확인
컨텍스트
32,768
Mi:dm 2.0 Mini 2.3B · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
Q4_K_M1.43 GB4 GB8 GBllama.cpp권장
Q5_K_M1.65 GB4.2 GB12 GBllama.cpp권장
Q8_02.46 GB5 GB12 GBllama.cpp권장
모델 원본·이용 조건
Falcon-H1 34B Instruct (TII · 아랍어)2개 설치 변형예상 VRAM 최소 27.4 GB
라이선스
falcon-llm-license · 이용 조건 제한
컨텍스트
262,144
Falcon-H1 34B Instruct (TII · 아랍어) · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
Q5_K_M23.87 GB27.4 GB32 GBllama.cppGPU 권장
Q8_035.77 GB39.9 GB48 GBllama.cppGPU 권장
모델 원본·이용 조건
Falcon-H1 34B Instruct GPTQ-Int8 (TII · vLLM)1개 설치 변형예상 VRAM 최소 50.6 GB
라이선스
falcon-llm-license · 이용 조건 제한
컨텍스트
8,192
Falcon-H1 34B Instruct GPTQ-Int8 (TII · vLLM) · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
GPTQ-Int844.09 GB50.6 GB64 GBvLLMGPU 권장
모델 원본·이용 조건
Falcon-H1 34B Instruct bf16 (TII · 아랍어 18개 언어)1개 설치 변형예상 VRAM 최소 75 GB
라이선스
falcon-llm-license · 이용 조건 제한
컨텍스트
262,144
Falcon-H1 34B Instruct bf16 (TII · 아랍어 18개 언어) · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
safetensors67.31 GB75 GB96 GBvLLMGPU 권장
모델 원본·이용 조건
Falcon-H1R 7B FP8 (TII · 추론특화 · 영어 전용)1개 설치 변형예상 VRAM 최소 11.4 GB
라이선스
falcon-llm-license · 이용 조건 제한
컨텍스트
262,144
Falcon-H1R 7B FP8 (TII · 추론특화 · 영어 전용) · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
safetensors8.4 GB11.4 GB24 GBvLLMGPU 권장
모델 원본·이용 조건
Falcon-H1 7B Instruct Q8_0 (TII · 아랍어 18개 언어)1개 설치 변형예상 VRAM 최소 9.8 GB
라이선스
falcon-llm-license · 이용 조건 제한
컨텍스트
262,144
Falcon-H1 7B Instruct Q8_0 (TII · 아랍어 18개 언어) · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
Q8_08.07 GB9.8 GB16 GBllama.cppGPU 권장
모델 원본·이용 조건
Qwen3.8 27B FP8 (Alibaba · 멀티모달)1개 설치 변형예상 VRAM 최소 37.3 GB
라이선스
apache-2.0 · 라이선스 확인
컨텍스트
262,144
Qwen3.8 27B FP8 (Alibaba · 멀티모달) · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
safetensors30.89 GB37.3 GB48 GBvLLMGPU 권장
모델 원본·이용 조건
Qwen3.8 27B Uncensored FP8 (멀티모달)1개 설치 변형예상 VRAM 최소 37.3 GB
라이선스
apache-2.0 · 라이선스 확인
컨텍스트
262,144
Qwen3.8 27B Uncensored FP8 (멀티모달) · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
safetensors30.89 GB37.3 GB48 GBvLLMGPU 권장
모델 원본·이용 조건
Nemotron 3 Nano Omni 30B-A3B FP8 (NVIDIA · DGX Spark 지원)1개 설치 변형예상 VRAM 최소 41.5 GB
라이선스
nvidia-open-model-license · 이용 조건 제한
컨텍스트
131,072
Nemotron 3 Nano Omni 30B-A3B FP8 (NVIDIA · DGX Spark 지원) · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
safetensors35.2 GB41.5 GB64 GBvLLMGPU 권장
모델 원본·이용 조건
K2-Horizon MoVA 36B-A4B FP8 (MBZUAI · 영어 전용)1개 설치 변형예상 VRAM 최소 55.4 GB
라이선스
apache-2.0 · 라이선스 확인
컨텍스트
524,288
K2-Horizon MoVA 36B-A4B FP8 (MBZUAI · 영어 전용) · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
safetensors48.39 GB55.4 GB96 GBvLLMGPU 권장
모델 원본·이용 조건
Jais-2 8B Chat Q8_0 (G42/Inception UAE · 아랍어 중심)1개 설치 변형예상 VRAM 최소 11 GB
라이선스
jais-community · 이용 조건 제한
컨텍스트
32,768
Jais-2 8B Chat Q8_0 (G42/Inception UAE · 아랍어 중심) · 설치 사양 보기
양자화·형식파일 크기예상 VRAM · 8K최소 시스템 RAM실행 엔진CPU 실행 권장
Q8_08.61 GB11 GB16 GBllama.cppGPU 권장
모델 원본·이용 조건

VRAM은 8K 문맥·동시 요청 1개·전체 GPU 로딩 기준입니다. 실제 점유량은 문맥 길이, 실행 엔진과 캐시 예약 설정에 따라 달라집니다. 시스템 RAM은 OS 여유를 포함한 장비 선택 기준이며 DGX Spark처럼 통합 메모리를 쓰는 장비는 VRAM과 RAM을 합산하지 않습니다.

폐쇄망에서는 로컬 실행 경로로.

모델과 실행 환경을 미리 반입하면 CAP·CAS에서 내부 문서와 함께 로컬 모델을 사용할 수 있습니다. 클라우드 관리형 AMLR은 외부 연결이 필요하므로, 에어갭에서는 로컬 모델로 파이프라인을 구성하세요.

DGX Spark 폐쇄망 활용 가이드

우리 업무에 맞는 모델 조합을 찾아보세요.

CAP에서 지식과 에이전트를 연결하고 단계별 모델을 구성해 실제 업무로 검증하세요.

CAP 살펴보기