제니퍼 AI 설치 및 구성 (서버 및 브라우저 LLM, MCP, 도움말 챗봇)

제니퍼 AI 기능 사용에 대한 약관은 제니퍼 AI 데이터 보안 정책 안내서를 참고해주세요.

서버 LLM

본 가이드는 JENNIFER5 사용자가 사내 폐쇄망 또는 인프라 내에 구축된 프라이빗 LLM(Private Server LLM) 서버를 연동하기 위한 기술 명세서입니다. 브라우저 LLM과 달리, 기업 내부 네트워크(On-premise)에 별도의 LLM 프록시 서버를 구축하여 제니퍼 인사이트 기능을 구동합니다.

모든 질의와 데이터 처리는 사내 보안망 내에서만 통신하므로, 외부 퍼블릭 클라우드로의 데이터 유출을 원천 차단하는 완벽한 보안(Privacy-First) 환경을 제공합니다.

특히 사내 독자 구축 모델(vLLM과 같은 OpenAI-Compatible API)은 물론, 엄격한 데이터 거버넌스가 적용된 기업용 엔터프라이즈 환경(Upstage Solar Private, Azure OpenAI, AWS Bedrock)까지 유연하게 수용할 수 있는 아키텍처와 최적화 구성 전략을 다룹니다.

설치 파일 구성

제니퍼 인사이트 기능은 5.6.5 버전 이후 부터 사용할 수 있습니다. 1) 데이터 서버, 2) 뷰 서버를 업데이트 후, 3) 프록시 서버를 추가 설치해야 합니다.

제니퍼 서버와 마찬가지로 JDK 17 이상이 필요합니다.

설치 사양

항목

권장사양

CPU

2 core

메모리

2 GB 이상의 물리 메모리

하드디스크

30 GB 이상

OS

Linux, Windows (Linux를 권장)

설치 디렉토리 구성

프록시 서버의 압축 파일을 해제하면 server.llm 디렉토리가 생성되고, 아래와 같은 하위 디렉토리가 생성됩니다.

디렉토리명

설명

bin

실행파일들을 포함하고 있는 디렉토리

conf

설정파일들을 포함하고 있는 디렉토리

webapp

프록시 서버 애플리케이션을 포함한 디렉토리

db_data

인사이트 챗의 대화 기록이 저장되는 디렉토리

logs

프록시 서버의 로그를 저장하는 디렉토리

프록시 서버 설정 (server.llm/conf/server_llm.conf)

server_llm.conf 파일을 통해 서버를 설정합니다. 
사용하는 LLM 서버에 따라 달라지는 설정값이 있고, 달라지지 않는 공통 설정값이 있습니다.
다음은 공통 설정값입니다.

설정 이름

설명

llm_proxy_listen_port

프록시 서버 포트. 뷰서버에서 접속 가능해야 함

llm_proxy_db_filename

인사이트 챗 기록 저장 DB 파일 이름

llm_proxy_db_username

인사이트 챗 기록 저장 DB 사용자 이름

llm_proxy_db_password

인사이트 챗 기록 저장 DB 패스워드

다음은 사용하는 LLM 서버에 따라 달라지는 설정값입니다.
설치 환경에 따라 하나의 옵션만 선택해 적용합니다.

Upstage Solar

설정 이름

설명

llm_proxy_model_name

모델명. 예시 'solar-pro2'

llm_proxy_model_provider

모델제공자. 고정값 ‘private_solar’

llm_proxy_model_private_solar_apiurl

모델 URL. 내부 solar-pro2 URL

llm_proxy_model_private_solar_apikey

(Optional) 모델 API 인증 key

Azure OpenAI

설정 이름

설명

llm_proxy_model_name

모델명. 예시 'gpt-4.1'

llm_proxy_model_provider

모델제공자. 고정값 'azure_openai'

llm_proxy_model_azure_openai_deployment

Azure Foundry의 Model Deployment 이름

llm_proxy_model_azure_openai_endpoint

모델 URL. 예시 'https://jennifer-insight-azure-openai.openai.azure.com/'

llm_proxy_model_azure_openai_key

모델 API 인증 key

AWS Bedrock

설정 이름

설명

llm_proxy_model_name

모델명. 예시 'claude-sonnet-4-6'

llm_proxy_model_provider

모델제공자. 고정값 'aws_bedrock'

llm_proxy_model_aws_bedrock_modelid

AWS Bedrock의 Model ID. 예시 'anthropic.claude-sonnet-4-6'

llm_proxy_model_aws_bedrock_region

AWS Region. 예시 'us-west-2'

llm_proxy_model_aws_bedrock_aws_access_key_id

AWS Access Key ID

llm_proxy_model_aws_bedrock_aws_secret_access_key

AWS Secret Access Key

OpenAI-Compatible API

사내 LLM 운영 환경에서는 vLLM 사용을 허용 및 권장하며, Ollama는 운영 목적의 사용을 권장하지 않습니다.


vLLM은 배치 및 동시 요청 처리, 메모리 효율화 등 운영에 필요한 기능을 제공해 서비스 운영과 관리가 용이합니다. 반면 Ollama는 로컬 개발 편의성에 초점이 맞춰져 있어, 리소스 제어, 동시성 관리, API 설정, 로그 및 배포 표준화 측면에서 제한적입니다.


또한 자체 런타임과 패키징 방식에 의존해 사내 표준화가 어렵습니다. 따라서 사내 공용 LLM 서버는 vLLM을 기준으로 운영하며, Ollama는 개인 테스트 용도로만 사용하는 것을 권장합니다.

사내에 구축된 Private LLM 서버를 연동하는 방법입니다. 외부 인터넷 연결이 차단된 폐쇄망 환경이나, 데이터 보안이 최우선인 환경에서 OpenAI-Compatible API 규격을 지원하는 LLM 서버를 활용하여 제니퍼 인사이트와 연동할 수 있습니다.

설정 이름

설명

llm_proxy_model_name

모델명. 'openai/gpt-oss:120b'

llm_proxy_model_provider

모델제공자. 고정값 'private_openai'

llm_proxy_model_private_openai_internal_name

모델별칭 (선택사항)

llm_proxy_model_private_openai_apiurl

모델 URL. 'http://192.168.0.10:8000/v1'

llm_proxy_model_private_openai_maxtoken_in_k

컨텍스트 길이 (단위: K). '64'

llm_proxy_model_private_openai_image_support

멀티모달 지원 여부. 'false'

llm_proxy_model_generation_first_token_timeout_seconds

연결 타임아웃 설정 (기본 10초)

llm_proxy_model_generation_inactivity_timeout_seconds

응답 타임아웃 설정 (기본 3초)

프록시 서버 실행과 중지

프록시 서버는 아래와 같이 server.llm 디렉토리에서 스크립트를 통해 실행, 중지할 수 있습니다.

# 실행
server.llm$ bin/startup_llm.sh

# 중지
server.llm$ bin/shutdown_llm.sh
서버 실행 후에는 llm.log 파일을 통해 로그를 확인할 수 있습니다.

뷰 서버 설정 (server.view/conf/server_view.conf)

프록시 서버가 실행되면, 프록시 서버와 연결하기 위해 뷰 서버의 설정 파일을 수정해야 합니다. 다음은 뷰 서버 설정에 대한 설명입니다.

설정 이름

설명

llm_proxy_host

프록시 서버 호스트와 포트 (예: localhost:8080)

llm_proxy_uuid

프록시 서버에 등록할 뷰서버 ID (임의의 UUID)

llm_proxy_org

프록시 서버에 등록할 뷰서버 이름 (임의의 문자열)

llm_proxy_connection_timeout_seconds

연결 타임아웃 설정 (기본 10초)

llm_proxy_inactivity_timeout_seconds

응답 타임아웃 설정 (기본 10초)

뷰 서버 설정을 수정한 후 뷰 서버를 재시작해야합니다.

uuid 는 중복되지 않는 아이디를 만들기 위한 표준 규약입니다.

일반적으로 리눅스 계열 운영체제에서는 uuid 혹은 uuigen 명령으로 생성할 수 있습니다.

설치 확인

설치가 완료되면 설정 > 인사이트 챗 메뉴에서 아래와 같이 연결 상태를 확인할 수 있습니다.

브라우저 LLM

본 가이드는 JENNIFER5 사용자가 외부 네트워크 연결 없이 브라우저 내에서 직접 LLM(Large Language Model)을 구동하기 위한 기술 명세서입니다. 모든 추론(Inference) 과정은 클라이언트(사용자 PC)의 자원을 활용하여 수행되므로, 데이터가 외부 서버로 전송되지 않는 완벽한 보안(Privacy-First) 환경을 제공합니다.

특히 Chrome 121 (On-premise) 환경을 표준으로 하며, Windows, macOS, 그리고 엔터프라이즈 환경의 Linux (Vulkan 백엔드) 환경까지 포괄하는 최적화 전략을 다룹니다.


Gemini Nano 모드 사용 시 127 버전 이상 필수

상세 제약 및 요구사항

구분

상세 내용

브라우저

Google Chrome 121 이상 (Stable)

OS / Graphics

Windows 10/11, macOS 13+, Linux (Ubuntu 20.04+)


Linux는 Chrome이 Vulkan 백엔드를 사용하므로 Vulkan 드라이버 필수

네트워크 보안

HTTPS (Secure Context) 필수


HTTP에서는 WebGPU 및 SharedArrayBuffer 차단됨

하드웨어 권장

VRAM 4GB 이상 외장 GPU 권장 (내장 그래픽 구동 가능하나 속도 저하)

HTTP(내부망) 환경 주의 사항: 보안 정책상 WebGPUWebAssembly SIMD 가속이 기본적으로 차단됩니다. SSL 인증서 적용이 불가능한 폐쇄망 환경에서는 반드시 뷰서버 옵션을 통해 해당 오리진을 보안 컨텍스트로 강제 인식시켜야 합니다.

배포 전략 수립 (Decision Tree)

고객사의 인터넷 연결 상태에 따라 아래 순서대로 적용하십시오.

배포 시나리오

우선순위

시나리오 (네트워크)

권장 솔루션

특징

0순위 (권장)

완전 폐쇄망

(Air-grapped Network)

LiteRT-LM Web

(Gemma4-E2B-IT)

* 호환성 및 안정성: Google LiteRT-LM 기반 런타임으로 전환했음. Gemma 4 이후 모델부터 지원하며, 웹 실행용 `*-web.litertlm` 파일만 지원함. 기존 MediaPipe 레거시 모델(.bin, .task)은 지원하지 않으며, ONNX 대비 브라우저 충돌 가능성을 낮췄음.

1순위 (권장)

인터넷 연결 가능

(최초 1회라도 가능 시)

Gemini Nano

(Chrome Built-in AI)

  • 답변 성능: 브라우저 LLM 중 준수한 수준

  • 저사양 친화적: 비교적 리소스 점유가 적음

2순위 (대안)

완전 폐쇄망

(Air-gapped Network)

ONNX Runtime

(Qwen3-0.6B)

[0순위] MeidaPipe LiteRT-LM (Gemma4) 가이드

Google의 최신 온디바이스 AI 기술을 활용하여 브라우저 내에서 GPU 가속(WebGPU)을 통해 LLM을 구동합니다. ONNX 대비 월등히 높은 모델 구동 안정성을 보장하며, 폐쇄망 환경에서도 동작합니다.

HTTP 환경에서는 Unsafe WebGPU Support flag를 활성화해야 webgpu를 사용할 수 있습니다.

권장 사양 (MediaPipe Runtime)

주요 에러 케이스

구분

권장 (Recommended)

최소 (Minimum)

Model

E4B (고성능 모델)

E2B Only

(경량 모델 한정)

RAM

16GB 이상

8~16GB

* 4GB 환경 구동 불가

VRAM

6~8GB 이상 권장

2~4GB 권장

GPU

NVIDIA RTX 3060 / 4050 급 이상

NVIDIA GTX 1660 / M1 급 이상

모델 다운로드

아래 모델 파일들은 더이상 지원하지 않습니다.

디렉토리 배치

해당 모델 파일을 미리 다운로드하여 USB에 저장한 뒤, 고객사 환경에 수동으로 설치해 주십시오.

[1순위] Chrome Built-in AI (Gemini Nano) 가이드

인터넷 연결이 허용된다면, 별도의 모델 파일 관리 없이 최상의 성능을 내는 이 방식을 최우선으로 적용하십시오.

권장 사양 (Gemini Nano)

ONNX 방식보다 메모리 효율이 뛰어나, 사양이 낮은 PC에서도 대시보드와 함께 구동하기 유리합니다.

주요 에러 케이스

구분

권장 (Recommended)

최소 (Minimum)

CPU / NPU

NPU 탑재 프로세서 (Apple M1 이상, Intel Core Ultra, AMD Ryzen AI 시리즈)

AVX2 명령어를 지원하는 64비트 CPU

RAM

16GB 이상

8GB

VRAM

8GB 이상

4GB 이상

GPU

NVIDIA RTX 3060 / Apple M 시리즈 통합 메모리

DirectX 12 지원 통합/외장 그래픽

디스크 여유 공간이 22GB 이상 확보가 되어야 하며, 다운로드 후 사용 가능한 저장 공간이 10GB 미만으로 떨어지면 모델이 기기에서 삭제 될 수 있습니다.

활성화 방법 (Flags 설정)

  1. Chrome 주소창에 chrome://flags 입력

  2. Prompt API for Gemini Nano 검색 -> Enabled 선택

  3. 브라우저 재시작

Enables optimization guide on device Flag는 기능 활성화를 위한 절대적인 필수 조건은 아닙니다. 해당 옵션(BypassPrefRequirement)은 크롬이 PC 사양을 체크하여 기능을 차단하는 것을 강제로 우회하는 역할을 합니다. 따라서 고사양 PC에서는 굳이 설정하지 않아도 되지만, 8GB 램 등 저사양 PC에서는 이 설정이 없으면 작동하지 않을 가능성이 있습니다.

HTTP 환경에서는 Gemini Nano 사용이 차단될 수 있습니다. 이런 경우 Insecure origins treated as secure flag를 설정해 우회할 수 있습니다.

모델 설치 확인

[2순위] ONNX Runtime (Qwen3) 가이드

폐쇄망 환경이거나 특정 모델(Qwen3)을 반드시 사용해야 하는 경우 적용합니다. 리소스 사용량이 높으므로 사양 확인이 필수적입니다.

권장 사양 (ONNX Runtime)

대시보드 렌더링과 LLM 추론이 브라우저 탭 하나의 리소스를 공유하므로 높은 사양이 요구됩니다.

구분

Windows 권장 사양

Mac 권장 사양

RAM

최소 16GB / 권장 32GB

최소 16GB / 권장 24GB

VRAM

최소 6GB / 권장 8GB

-

GPU

RTX 3060

Apple Silicon M1 Pro 이상

Backend

WebGPU (DirectX 12)

WebGPU (Metal)

⚠️ 리소스 경합 주의: 시스템 메모리(RAM) 8GB 환경에서 ONNX 구동 시, 대시보드 조작 중 메모리 부족(OOM)으로 탭이 강제 종료될 확률이 매우 높습니다.

모델 다운로드

향후 기술 발전에 따라 Qwen3-0.6B보다 더욱 최적화된 모델이 도입될 수 있으며, 기본 모델 변경 시에는 별도로 안내해 드리겠습니다.

디렉토리 배치

해당 모델 파일을 미리 다운로드하여 USB에 저장한 뒤, 고객사 환경에 수동으로 설치해 주십시오.

모델 포맷 선정 가이드 (Dynamic Loading)

고객 PC 환경에 맞춰 적절한 모델 파일을 로드하도록 설정하십시오.

상황

파일명

설명

Windows WebGPU

onnx/model_fp16.onnx

  • 표준 권장

  • DirectX 12 환경에서 가장 빠르고 정확함

Mac WebGPU

onnx/model_q4f16.onnx

  • 안정성 우선 권장

  • Metal 버퍼 할당 제한(Crash) 이슈 회피를 위해 0.6B 모델이라도 q4f16 필수

WASM Fallback

onnx/model_q4f16.onnx

  • CPU 전용 권장

  • WebGPU 실패 시 CPU 부하를 최소화하기 위해 사용

OS별 최적화 (WebGPU)

Windows 환경 (NVIDIA/AMD)

Override software rendering list 활성화는 chrome://flags에서 할 수 있음

Mac 환경 (Apple Silicon)

트러블슈팅 가이드

주요 에러 케이스

증상

원인

해결책

기능 작동 불가 (차단)

프로토콜 위반 (HTTP)

주소창이 http://인지 확인. HTTPS 변경 또는 The internal link is invalid.

Mac에서 Aborted 에러 발생하며 탭 종료

Metal 버퍼 할당 제한


M2/M3 Max 등 고사양에서도 fp16 모델 로딩 시 단일 텐서 크기가 브라우저 허용치를 초과하여 발생

q4f16 모델로 변경하여 재시도 안내 (메모리 부족이 아닌 할당 구조 문제임)

속도가 매우 느림 (글자가 한 자씩 나옴)

WASM(CPU) 동작

GPU 드라이버 업데이트 및 하드웨어 가속 설정 확인

대시보드 멈춤

메모리 부족

8GB RAM PC인 경우 사용 불가 안내 (Gemini Nano 전환 시도 권장)

부록: HTTP 환경 강제 활성화 (Flag 설정)

SSL 인증서 발급이 어려운 내부망(Private Network) 환경에서 IP 주소(http://192.168.x.x)로 접속해야 할 경우, 아래 설정을 통해 WebGPU 및 Gemini Nano를 강제로 활성화할 수 있습니다.

  1. Chrome 주소창에 chrome://flags/#unsafely-treat-insecure-origin-as-secure 입력

  2. Insecure origins treated as secure 항목을 Enabled로 변경

  3. 텍스트 박스에 현재 접속하는 서버 주소를 입력 (예: http://192.168.0.100)

    • 포트가 있다면 포트까지 포함 (예: http://192.168.0.100:8080)

  4. 우측 하단 Relaunch 버튼 클릭하여 브라우저 재시작

요약 (엔지니어 체크리스트)

  1. Browser Version: Chrome 121+ (Nano 사용 시 127+) 확인 완료

  2. Protocol Security: HTTPS 접속 또는 Flag 예외 처리 완료

  3. Model Files: .task 또는 .onnx 파일 경로 및 권한 확인

  4. Graphics Driver: chrome://gpu에서 WebGPU/Vulkan 가속 상태 확인

  5. Memory Check: 고객 PC의 가용 RAM이 모델 요구사항(VRAM 공식 참조)을 충족하는지 확인

MCP 연결

제니퍼 LLM 프록시 서버는 MCP(Model Context Protocol) 서버 역할을 동시에 수행합니다.
사내 폐쇄망 내부에서 구동되는 Private LLM 또는 로컬 LLM 서버에 연결된 MCP 클라이언트가 있는 경우, 제니퍼 LLM 프록시 서버에 연동하여 실시간 제니퍼 APM 데이터에 안전하게 접근하고 분석 작업을 수행할 수 있습니다.

기본 연결 설정 정보

MCP 클라이언트에서 제니퍼 LLM 프록시 서버에 직접 연결하려면 아래의 설정 옵션이 필요합니다.

설정 항목

입력 값 / 설정 내용

MCP 서버 타입

(Streamable) HTTP

MCP 서버 URL

<llm-proxy-server:port>/mcp

헤더

아래의 제니퍼 OpenAPI용 인증 헤더 2종 필수 추가

필수 요청 헤더

MCP 서버는 제니퍼 OpenAPI를 통해 데이터를 조회하므로, MCP 클라이언트 헤더 설정에 아래 옵션을 반드시 입력해 주셔야 합니다.

제니퍼 OpenAPI 관련 참고 링크 제니퍼 OpenAPI의 규격, 가용 파라미터 및 API 스펙 정보는 공식 제니퍼 OpenAPI 스펙 문서에서 자세히 확인하실 수 있습니다.

폐쇄망 환경 참고 사항 폐쇄망 내부에서는 보안 정책 상 Claude Desktop 앱이나 CLI 등의 외부 연동형 MCP 클라이언트를 직접 사용하기 어려울 수 있습니다. 이 경우, 사내 내부에 자체 설치 및 오프라인 구동이 가능한 오픈소스 웹 인터페이스인 Open WebUI를 활용하시는 것을 적극 권장합니다.

Open WebUI 연동 가이드

사내 가상화나 로컬 환경에서 가장 널리 쓰이는 Open WebUI에 제니퍼 MCP를 연동하는 구체적인 순서는 다음과 같습니다.

단계 1: MCP 연결 등록

  1. Open WebUI 웹 콘솔에 로그인 후 왼쪽 하단의 사용자 프로필 메뉴 > Admin Panel > Settings > Integrations 화면으로 이동합니다.

  2. Manage Tool Servers 항목 우측의 + 버튼 혹은 Add Connection을 선택합니다.

  3. 아래와 같이 연결 세부 정보를 입력합니다.

    1. Type: MCP (Streamable HTTP)

    2. Name / ID: jennifer-mcp (자유롭게 입력 가능)

    3. Description: 서비스 식별을 위한 설명 입력

    4. URL: https://<llm-proxy-server:port>/mcp (예: https://insight.jennifersoft.com/mcp)

    5. Auth: None

    6. Headers: 아래와 같이 JSON 포맷으로 제니퍼 API 접속 정보를 입력합니다.

  4. 입력을 완료하고 Save 버튼을 클릭하여 연결을 저장합니다.

단계 2: 채팅창 내 도구(Tool) 활성화

  1. 새 대화 창으로 이동한 후 사용할 LLM 모델(예: llama3.1:8b)을 선택합니다.

  2. 입력창 좌측 하단의 도구 아이콘(플러그/스패너 모양)을 클릭하고 Tools 하위 메뉴를 엽니다.

  3. 등록한 jennifer-mcp 항목 우측의 토글 스위치를 활성화(Green 온 상태)합니다.

단계 3: 동작 테스트 및 활용법

제니퍼 MCP 도구가 올바르게 연결되었는지 확인하기 위해 아래와 같이 질문을 던져 테스트할 수 있습니다.

도움말 챗봇

제니퍼 도움말 챗봇은 제니퍼와 관련된 다양한 자료를 기반으로 사용자의 질문에 답변하는 ChatGPT 기반 챗봇 서비스입니다.

이 서비스는 제니퍼 매뉴얼, 에이전트 고급 옵션 가이드, 제니퍼 블로그, 릴리즈 노트 등 여러 자료를 검색하여 제니퍼 제품과 관련된 기능, 설정, 운영 방법, 에이전트 옵션, 버전별 변경 사항 등에 대한 정보를 보다 빠르게 확인할 수 있도록 지원합니다.

사용자는 기존 문서를 직접 찾아보지 않아도 자연어로 질문하여 필요한 내용을 확인할 수 있으며, 제니퍼 사용 및 기술 지원 과정에서 참고 자료로 활용할 수 있습니다.

현재 제니퍼 도움말 챗봇은 엔지니어와 고객을 대상으로 제공됩니다. 엔지니어는 제니퍼소프트 Asana를 통해 인증할 수 있으며, 고객은 별도의 신청 페이지를 통해 이용할 수 있습니다. 고객 신청 방법에 대한 자세한 내용은 별도 섹션에서 안내합니다.

고객 가입 신청 페이지

신청 페이지에서 이름, 이메일, 전화번호, 회사명 등을 입력해 신청하실 수 있습니다. 다만 일반 고객은 내부 승인 절차를 거친 뒤 가입이 완료되니 참고해 주십시오.

https://chatbot.jennifersoft.com/register

모바일 앱 설치 방법

PWA(Progressive Web App)는 웹 기술로 개발되지만 설치하면 홈 화면에 아이콘이 생성되고 오프라인에서도 동작하는 앱처럼 사용할 수 있는 응용 프로그램입니다. 이 방식은 데스크톱뿐만 아니라 모바일에서도 동일하게 적용되며, 안드로이드와 iOS 모두에서 설치를 지원하므로 기종과 브라우저에 관계없이 동일한 사용자 경험을 제공합니다.

모바일에서 설치하는 방법도 간단합니다. 웹 앱을 브라우저에서 열고 우측 상단의 메뉴 버튼(안드로이드 Chrome은 ‘⋮’, iOS Safari는 ‘공유’ 아이콘)을 탭한 뒤 메뉴에서 홈 화면에 추가를 선택합니다. 나타나는 팝업에서 ‘추가’를 눌러 설치를 완료하면 홈 화면에 아이콘이 생성되고 앱처럼 실행할 수 있습니다. Android와 iOS 모두 동일한 메뉴 이름을 사용하므로, 홈 화면에 추가 옵션을 찾기만 하면 쉽게 설치할 수 있습니다.

안드로이드 폰에서 설치 방법

데스크탑 챗봇과 달리 모바일 챗봇은 모든 채팅 히스토리를 로컬에 저장하며, 최대 1TB의 용량까지 사용할 수 있다.