CLUE 제품 소개로 돌아가기

CLUE 기술 문서

통합 AI 데이터 엔진의 구조와 성능

그래프, 벡터, 키워드 검색 구조부터 데이터 인제스트, 이전, 배포 사양과 벤치마크 조건까지 확인합니다.

핵심 기능

관계까지 저장해야 AI가 제대로 답합니다.

그래프 DB, 벡터 DB, 검색엔진을 따로 세우지 마세요. CLUE 한 엔진이면 됩니다.

지식 그래프 · n-hop 순회

엔티티와 관계를 그래프로 저장하고 n-hop으로 순회합니다. 그래프 전용 DB를 따로 세우지 않아도 됩니다.

RAG 4 검색 모드

그래프(엔티티 연결)·다단계 추론(연관 탐색)·하이브리드(벡터+키워드)·벡터를 모드 하나로 바꿉니다.

그래프 · 벡터 · 키워드, 같은 데이터베이스

세 검색 방식을 PostgreSQL 안에서 운영합니다. 별도 데이터 시스템 사이의 복제와 동기화 부담을 줄입니다.

57개 확장자 · 배치 처리

문서와 미디어를 비동기로 처리하고 진행 상태를 보여줍니다. 처리시간은 파일 크기와 형식, 모델 및 장비에 따라 달라집니다.

테넌트 격리 (데이터·키 분리)

테넌트별 실행 환경과 데이터베이스를 분리하고, 역할에 따라 데이터 접근을 관리합니다.

외부 소스 10종 이전

소스 연결, 대상 적재 구조, 샘플 데이터를 확인한 뒤 배치로 옮깁니다. 내부 AICLUDE용 어댑터는 별도 1종입니다.

Architecture

원문 확인부터 검색까지, 단계가 보이는 처리.

원문 추출, 명제와 관계 추출, 임베딩과 검색 준비를 순차 진행합니다. 전체 과정이 하나의 트랜잭션이나 고정 시간으로 끝나는 것은 아닙니다.

PipelineFile → Answer · single Postgres transaction
Ingest
파일 업로드 · 57개 확장자
Chunk
의미 기반 분할
Embed
텍스트 임베딩
Store
그래프 · 벡터 · 키워드
Search
4 모드 라우팅
Answer
LLM + 출처 인용
4 ModesSame API · `mode` param swap
mode = "classic"
Classic
벡터 인덱스 · 벡터 유사도 검색
mode = "hybrid"
Hybrid
벡터 + 키워드 융합 검색
mode = "graph"
Graph
엔티티 · 관계 탐색
mode = "multi-hop"
Multi-hop
Leiden 커뮤니티 + 다단계 추론
Engine
Vector SearchKeyword SearchKnowledge GraphDistributed ClusterBackup · RestoreKubernetes-nativeText Embedding

원문과 검색 준비 상태는 다를 수 있습니다. 파일 처리 및 그래프 구성 상태를 확인한 뒤 검색 결과를 검토하세요.

성능 벤치마크

같은 환경에서 측정한 탐색과 검색 성능

동일한 데이터와 컴퓨팅 환경에서 측정한 처리시간을 비교합니다.

처리시간이 낮을수록 빠릅니다

Graph n-hop 탐색

1-hop
Apache AGE
28.5ms
CLUE Engine
3.7ms
8x
2-hop
Apache AGE
24.5ms
CLUE Engine
2.23ms
11x
3-hop
Apache AGE
30.9ms
CLUE Engine
2.64ms
12x

키워드 검색 100개 쿼리

VectorChord-BM257,790ms
CLUE Engine3,081ms

엣지 3,187개 적재

Apache AGE2,047ms
CLUE Engine198ms
측정 조건과 해석
  • Graph: 노드 3,595개, 엣지 3,187개, 동일 컨테이너 4 vCPU, 8GB, 동일 CSV, 20회 반복.
  • Keyword: 동일 문서 4,000건, 동일 쿼리 100개, EXPLAIN ANALYZE 3회 중앙값.
  • 내부 비교 측정값으로, Apache AGE와 VectorChord-BM25만 비교했습니다. Neo4j·Elastic·Pinecone과의 직접 성능 비교는 하지 않았으며, 실제 결과는 데이터 규모와 쿼리에 따라 달라집니다.
Self-hosted Stack

Podman 셀프 호스팅 스택

단일 노드 기준에서 시작합니다. HA·샤딩·Kubernetes는 아래 계획 사양을 바탕으로 적용 가능성과 복구 목표를 검토합니다.

Podman 컨테이너
API · SDK 클라이언트
모니터링
clue-fe
어드민 콘솔
지식·검색·처리 현황·보안 상태 확인.
clue-be
API 서버
REST + gRPC, 검색 모드 라우팅을 처리합니다.
conn-pool
커넥션 풀
트랜잭션 풀링으로 연결 수를 아낍니다.
clue-serverengine
벡터·키워드·지식 그래프 통합 엔진
같은 데이터베이스에서 벡터·키워드·관계 검색.
파일 입력 (PDF · DOCX · 음성 · 영상)
batch-ledgerqueue
영속 배치 원장
처리 상태를 DB에 저장하고 재시작 후 이어서 처리.
clue-ingestpipeline
Ingest 파이프라인
PDF·DOCX·이미지·오디오·영상 자동 처리.
clue-embedding
Embedding
텍스트 임베딩.
image-vectors
이미지 임베딩
이미지·캡션 임베딩.
metrics-agentmetrics
메트릭 수집기
metrics-collectorcollect
메트릭 수집
메트릭 수집과 알림 규칙.
dashboarddashboards
모니터링 대시보드
검색 지연·수집 처리량 대시보드.
  • 최소 (single)
    vCPU
    4 vCPU
    메모리
    16 GB
    디스크
    100 GB SSD

    단일 노드, Community 라이선스 이상.

  • 권장 (HA)권장
    vCPU
    4 vCPU
    메모리
    16 GB
    디스크
    200 GB SSD

    3노드 계획 기준. Professional 기능 범위와 복구 목표는 별도 검증.

  • 대용량 (샤딩)
    vCPU
    8 vCPU
    메모리
    32 GB
    디스크
    500 GB SSD

    1 코디네이터 + 3 워커, Enterprise 라이선스.

  • Kubernetes
    vCPU
    K8s 1.27+
    메모리
    K8s Operator
    디스크
    PVC

    쿠버네티스 운영, Enterprise 라이선스.

  • 한 데이터베이스에서 벡터·키워드·지식 그래프를 모두 처리하므로 별도 검색 엔진이 필요 없습니다.
  • 외부 임베딩 모델 컨테이너를 재사용해 GPU 노드를 공유합니다.
  • 표의 수치는 계획 검토용입니다. 데이터 규모·모델·확장 기능에 맞춰 장비와 라이선스, 장애 복구를 검증하세요.
Use Cases

관계가 중요한 데이터라면.

AICLUDE 플랫폼 자체가 CLUE 위에서 돌아갑니다.

법령 · 규정 지식 그래프

조항·고시·지침을 참조 관계로 이어 답변과 함께 근거 조항을 짚어 줍니다.

근거 조항 추적

조직 지식 베이스

위키·보고서·매뉴얼을 한 번에 인제스트하고 부서 권한별로 답변을 나눕니다.

관련 근거를 한 곳에서 확인

코드 · 기술 문서

코드와 기술 문서에서 추출한 내용을 함께 검색해 변경 배경과 관련 자료를 찾습니다.

코드와 문서를 함께 검색

멀티모달 지식 베이스

PDF·이미지·영상·오디오를 같은 컬렉션에 임베딩해 포맷을 가리지 않고 찾습니다.

포맷 무관 검색
왜 CLUE인가

그래프 DB가 필요한 자리를 한 엔진으로.

그래프 DB를 따로 세우지 않습니다
그래프·벡터·키워드를 같은 데이터베이스에서 운영합니다. 세 제품 사이의 데이터 복제와 인덱스 동기화 작업을 줄일 수 있습니다.
자체 개발 그래프·검색 엔진
자체 개발한 Rust 확장 clue_engine이 그래프 n-hop 순회와 BM25 랭킹을 PostgreSQL 안에서 직접 수행합니다.
GraphRAG 다단계 추론
Leiden 커뮤니티 탐지로 그래프를 요약하고 여러 홉 떨어진 근거까지 모아 답합니다.
복구 목표에 맞춘 배포 검토
단일 노드에서 시작하고 필요에 따라 고가용성·샤딩 구성을 검토합니다. 복구시간과 데이터 손실 허용치는 고객 환경에서 검증합니다.
보안 설정의 실제 상태 확인
운영 화면에서 암호화와 감사 로깅의 활성·비활성·미확인 상태를 확인합니다. 저장소·백업 암호화와 적용 범위는 배포 시 별도로 점검합니다.
샘플 점검 후 단계적 이전
외부 소스 10종과 내부 전용 1종을 지원합니다. 예상 건수와 변환 경고를 먼저 보고, 지원 SDK 범위와 대상 검색 경로를 확인합니다.
CLUE 도입 안내

그래프까지 담는 데이터베이스로 시작하세요.

현재 사용 중인 데이터베이스와 운영 환경에 맞춰 CLUE 도입과 데이터 이전을 상담해 보세요.