1. 두 가지 AI 모델 구동 방식 (엔진) 비교
본 웹 IDE는 사용자의 브라우저 내에서 직접 구동되는 두 가지 독립적인 온디바이스(On-Device) 로컬 AI 실행 방식을 지원합니다.
원하시는 용도나 소장하고 계신 파일 형식에 맞춰 알맞은 모델을 선택하여 구동할 수 있습니다.
Engine 1 · Google WebGPU
1. MediaPipe 방식 (.task / .litertlm)
버튼: Open Local AI Model (.task)
구글이 개발한 MediaPipe Tasks-GenAI & LiteRT 기반 엔진입니다. 웹 브라우저의 WebGPU 하드웨어 가속을 적극 활용하여 초고속 추론을 제공하며, 텍스트 뿐만 아니라 이미지 인식(Vision 멀티모달) 분석 기능을 공식 지원합니다.
⚡ 장점: WebGPU 최적화 고속 추론, 이미지(Vision) 캡처 분석 가능
📁 지원 포맷: .task, .litertlm
🎯 대표 모델: Gemma-4 (텍스트), Gemma-3n (이미지+텍스트)
Engine 2 · WebAssembly / llama.cpp
2. Wllama 방식 (.gguf)
버튼: Open Local AI Model (.gguf)
전 세계 오픈소스 LLM 생태계의 표준인 GGUF 포맷 및 llama.cpp 기반 WebAssembly 엔진(Wllama)입니다. Hugging Face에 등록된 방대한 오픈소스 모델(Qwen, Llama, Mistral 등)을 양자화 단계별로 자유롭게 골라 쓸 수 있습니다.
🌐 장점: 수많은 최신 오픈소스 모델 지원, 저사양 PC에 최적화된 양자화
📁 지원 포맷: .gguf (단일 파일 / Q4_K_M 등)
🎯 대표 모델: Qwen2.5-Coder (코딩 특화), Llama-3.2, Gemma-2 GGUF
| 구분 |
MediaPipe 방식 (.task / .litertlm) |
Wllama 방식 (.gguf) |
| 열기 버튼 |
Open Local AI Model (.task) |
Open Local AI Model (.gguf) |
| 구동 엔진 기술 |
Google MediaPipe LLM WebGPU (LiteRT) |
Wllama (llama.cpp WebAssembly / WebGPU) |
| 파일 확장자 |
.task, .litertlm |
.gguf |
| 지원 기능 (모달리티) |
텍스트 코딩 + 이미지(Vision) 분석 |
텍스트 코딩 & 대화 (다국어 / 고도화된 추론) |
| 추천 대상 |
화면 캡처 UI 분석, Google 공식 WebGPU 모델 선호 시 |
최신 코딩 특화 오픈소스 모델(Qwen 등), 가벼운 모델 선호 시 |
| 메모리 / 권장 크기 |
FP16 / INT4 (약 2.9GB ~ 4.3GB) |
1B ~ 3B 파라미터 크기 / Q4_K_M 양자화 권장 (약 0.8GB ~ 2GB) |
2. MediaPipe 모델 다운로드 (.task / .litertlm)
Google 공식 WebGPU 엔진으로 구동할 모델입니다. Hugging Face 리포지토리에서 실제 대용량 모델 파일을 내려받으세요.
Gemma-4 (텍스트/코딩)
Text Only
파일명: gemma-4-E4B-it-web.task (약 2.96 GB)
코드 생성, 소스 분석 및 논리적 대화 작업에 최적화된 구글 모델입니다. 파일 목록에서 gemma-4-E4B-it-web.task 파일명 우측의 다운로드 화살표를 눌러 다운로드하세요.
Gemma-4 다운로드 리포지토리 ↗
Gemma-3n (이미지/멀티모달)
[Vision 지원]
파일명: gemma-3n-E4B-it-int4-Web.litertlm (약 4.27 GB)
웹 화면 캡처, 디자인 스케치 등 이미지를 함께 첨부하여 코드를 생성할 때 필수적입니다. 파일 목록에서 gemma-3n-E4B-it-int4-Web.litertlm 파일명 우측의 다운로드 화살표를 눌러 받으세요.
Gemma-3n 다운로드 리포지토리 ↗
3. GGUF 모델 다운로드 (.gguf)
글로벌 오픈소스 생태계의 다양한 최신 소형 언어 모델(SLM)을 사용하실 수 있습니다.
웹 브라우저의 탭 메모리 한계를 감안하여 1B ~ 3B 크기 및 `Q4_K_M` 양자화 포맷을 권장합니다.
Qwen2.5-Coder-1.5B
강력 추천 / 코딩 특화
추천 파일: qwen2.5-coder-1.5b-instruct-q4_k_m.gguf (약 986 MB)
Alibaba의 최신 코딩 특화 모델로, 1.5B라는 가벼운 용량에도 불구하고 HTML/CSS/JS 및 알고리즘 구현 능력이 매우 탁월하며 한국어 이해도가 우수합니다.
Qwen2.5-Coder GGUF 받기 ↗
Llama-3.2-1B-Instruct
초경량 / 빠른 속도
추천 파일: Llama-3.2-1B-Instruct-Q4_K_M.gguf (약 800 MB)
Meta의 최신 초경량 모델입니다. 1GB 미만의 용량으로 로딩 속도가 매우 빠르고 부드러운 대화 및 소스 설명 능력을 보여줍니다. 사양이 낮은 노트북 환경에 적합합니다.
Llama-3.2-1B GGUF 받기 ↗
Gemma-2-2B-it (GGUF)
논리 연산 우수
추천 파일: gemma-2-2b-it-Q4_K_M.gguf (약 1.6 GB)
Google Gemma 2세대 아키텍처의 2B 오픈 모델 GGUF 버전입니다. 정교한 논리력과 풍부한 어휘력을 갖추고 있어 다용도 어시스턴트로 유용합니다.
Gemma-2-2B GGUF 받기 ↗
💡 GGUF 파일명 읽는 법 & 양자화 팁
Hugging Face에서 GGUF 리포지토리에 들어가면 수많은 파일이 있습니다.
• Q4_K_M: 4비트 양자화로 파일 용량을 획기적으로 줄이면서도 성능 손실이 거의 없어 브라우저 웹 환경에서 가장 권장되는 규격입니다.
• Q5_K_M / Q8_0: 품질이 더 높으나 파일 크기와 메모리 점유율이 상승합니다.
• 브라우저는 한 탭당 메모리 제한(통상 2~4GB)이 있으므로 7B 이상의 대형 모델보다는 1B~3B 크기의 모델을 선택해 주셔야 튕김 없이 안정적으로 동작합니다.
4. 다운로드한 모델 로드하기 (방식별 절차)
다운로드한 파일 형식에 맞는 버튼을 선택하여 모델을 브라우저에 로드하세요.
방식 A: .task / .litertlm 파일 로드
- 상단 툴바에서 Open Local AI Model (.task) 버튼을 클릭합니다.
- 탐색기 창에서 다운로드한
.task 또는 .litertlm 파일을 선택합니다.
- 상단 보라색 프로그레스 바가 흐르며 WebGPU 가속 엔진으로 모델이 복사됩니다.
- 로드가 완료되면 상단 상태 뱃지가 ready로 바뀌며 대화 및 비전 첨부가 가능해집니다.
방식 B: .gguf 파일 로드
- 상단 툴바에서 Open Local AI Model (.gguf) 버튼을 클릭합니다.
- 탐색기 창에서 다운로드한
.gguf 모델 파일(예: Qwen2.5-Coder 등)을 선택합니다.
- 브라우저가 Wllama WebAssembly 가상 머신과 모델 텐서를 즉각 파싱합니다.
- 로드가 완료되면 상단 상태 뱃지가 GGUF ready로 켜지며 고속 로컬 코딩 대화가 시작됩니다.
📢 다운로드 시 필수 주의사항 (Git LFS 포인터 오류 방지)
Hugging Face 리포지토리에서 다운로드할 때 파일명을 그대로 마우스 우클릭하여 '다른 이름으로 저장' 하시면 실제 대용량 모델이 아닌 몇 백 바이트 크기의 Git LFS 포인터(텍스트 파일)만 저장되어 로드 시 오류가 발생합니다.
반드시 파일 목록 우측 끝에 위치한 다운로드 아이콘(↓ 화살표 기호)을 직접 클릭하여 최소 수백 MB에서 수 GB에 달하는 온전한 파일을 다운로드하셔야 정상 동작합니다.