AI Model Download & Engine Guide

MediaPipe (.task) & Wllama (.gguf) 2가지 독립 구동 엔진 가이드
메인 화면으로 ↗

1. 두 가지 AI 모델 구동 방식 (엔진) 비교

본 웹 IDE는 사용자의 브라우저 내에서 직접 구동되는 두 가지 독립적인 온디바이스(On-Device) 로컬 AI 실행 방식을 지원합니다. 원하시는 용도나 소장하고 계신 파일 형식에 맞춰 알맞은 모델을 선택하여 구동할 수 있습니다.

Engine 1 · Google WebGPU
1. MediaPipe 방식 (.task / .litertlm)
버튼: Open Local AI Model (.task)
구글이 개발한 MediaPipe Tasks-GenAI & LiteRT 기반 엔진입니다. 웹 브라우저의 WebGPU 하드웨어 가속을 적극 활용하여 초고속 추론을 제공하며, 텍스트 뿐만 아니라 이미지 인식(Vision 멀티모달) 분석 기능을 공식 지원합니다.
장점: WebGPU 최적화 고속 추론, 이미지(Vision) 캡처 분석 가능
📁 지원 포맷: .task, .litertlm
🎯 대표 모델: Gemma-4 (텍스트), Gemma-3n (이미지+텍스트)
Engine 2 · WebAssembly / llama.cpp
2. Wllama 방식 (.gguf)
버튼: Open Local AI Model (.gguf)
전 세계 오픈소스 LLM 생태계의 표준인 GGUF 포맷 및 llama.cpp 기반 WebAssembly 엔진(Wllama)입니다. Hugging Face에 등록된 방대한 오픈소스 모델(Qwen, Llama, Mistral 등)을 양자화 단계별로 자유롭게 골라 쓸 수 있습니다.
🌐 장점: 수많은 최신 오픈소스 모델 지원, 저사양 PC에 최적화된 양자화
📁 지원 포맷: .gguf (단일 파일 / Q4_K_M 등)
🎯 대표 모델: Qwen2.5-Coder (코딩 특화), Llama-3.2, Gemma-2 GGUF
구분 MediaPipe 방식 (.task / .litertlm) Wllama 방식 (.gguf)
열기 버튼 Open Local AI Model (.task) Open Local AI Model (.gguf)
구동 엔진 기술 Google MediaPipe LLM WebGPU (LiteRT) Wllama (llama.cpp WebAssembly / WebGPU)
파일 확장자 .task, .litertlm .gguf
지원 기능 (모달리티) 텍스트 코딩 + 이미지(Vision) 분석 텍스트 코딩 & 대화 (다국어 / 고도화된 추론)
추천 대상 화면 캡처 UI 분석, Google 공식 WebGPU 모델 선호 시 최신 코딩 특화 오픈소스 모델(Qwen 등), 가벼운 모델 선호 시
메모리 / 권장 크기 FP16 / INT4 (약 2.9GB ~ 4.3GB) 1B ~ 3B 파라미터 크기 / Q4_K_M 양자화 권장 (약 0.8GB ~ 2GB)

2. MediaPipe 모델 다운로드 (.task / .litertlm)

Google 공식 WebGPU 엔진으로 구동할 모델입니다. Hugging Face 리포지토리에서 실제 대용량 모델 파일을 내려받으세요.

Gemma-4 (텍스트/코딩) Text Only
파일명: gemma-4-E4B-it-web.task (약 2.96 GB)
코드 생성, 소스 분석 및 논리적 대화 작업에 최적화된 구글 모델입니다. 파일 목록에서 gemma-4-E4B-it-web.task 파일명 우측의 다운로드 화살표를 눌러 다운로드하세요.
Gemma-4 다운로드 리포지토리 ↗
Gemma-3n (이미지/멀티모달) [Vision 지원]
파일명: gemma-3n-E4B-it-int4-Web.litertlm (약 4.27 GB)
웹 화면 캡처, 디자인 스케치 등 이미지를 함께 첨부하여 코드를 생성할 때 필수적입니다. 파일 목록에서 gemma-3n-E4B-it-int4-Web.litertlm 파일명 우측의 다운로드 화살표를 눌러 받으세요.
Gemma-3n 다운로드 리포지토리 ↗

3. GGUF 모델 다운로드 (.gguf)

글로벌 오픈소스 생태계의 다양한 최신 소형 언어 모델(SLM)을 사용하실 수 있습니다. 웹 브라우저의 탭 메모리 한계를 감안하여 1B ~ 3B 크기`Q4_K_M` 양자화 포맷을 권장합니다.

Qwen2.5-Coder-1.5B 강력 추천 / 코딩 특화
추천 파일: qwen2.5-coder-1.5b-instruct-q4_k_m.gguf (약 986 MB)
Alibaba의 최신 코딩 특화 모델로, 1.5B라는 가벼운 용량에도 불구하고 HTML/CSS/JS 및 알고리즘 구현 능력이 매우 탁월하며 한국어 이해도가 우수합니다.
Qwen2.5-Coder GGUF 받기 ↗
Llama-3.2-1B-Instruct 초경량 / 빠른 속도
추천 파일: Llama-3.2-1B-Instruct-Q4_K_M.gguf (약 800 MB)
Meta의 최신 초경량 모델입니다. 1GB 미만의 용량으로 로딩 속도가 매우 빠르고 부드러운 대화 및 소스 설명 능력을 보여줍니다. 사양이 낮은 노트북 환경에 적합합니다.
Llama-3.2-1B GGUF 받기 ↗
Gemma-2-2B-it (GGUF) 논리 연산 우수
추천 파일: gemma-2-2b-it-Q4_K_M.gguf (약 1.6 GB)
Google Gemma 2세대 아키텍처의 2B 오픈 모델 GGUF 버전입니다. 정교한 논리력과 풍부한 어휘력을 갖추고 있어 다용도 어시스턴트로 유용합니다.
Gemma-2-2B GGUF 받기 ↗
💡 GGUF 파일명 읽는 법 & 양자화 팁
Hugging Face에서 GGUF 리포지토리에 들어가면 수많은 파일이 있습니다.
Q4_K_M: 4비트 양자화로 파일 용량을 획기적으로 줄이면서도 성능 손실이 거의 없어 브라우저 웹 환경에서 가장 권장되는 규격입니다.
Q5_K_M / Q8_0: 품질이 더 높으나 파일 크기와 메모리 점유율이 상승합니다.
• 브라우저는 한 탭당 메모리 제한(통상 2~4GB)이 있으므로 7B 이상의 대형 모델보다는 1B~3B 크기의 모델을 선택해 주셔야 튕김 없이 안정적으로 동작합니다.

4. 다운로드한 모델 로드하기 (방식별 절차)

다운로드한 파일 형식에 맞는 버튼을 선택하여 모델을 브라우저에 로드하세요.

방식 A: .task / .litertlm 파일 로드

  1. 상단 툴바에서 Open Local AI Model (.task) 버튼을 클릭합니다.
  2. 탐색기 창에서 다운로드한 .task 또는 .litertlm 파일을 선택합니다.
  3. 상단 보라색 프로그레스 바가 흐르며 WebGPU 가속 엔진으로 모델이 복사됩니다.
  4. 로드가 완료되면 상단 상태 뱃지가 ready로 바뀌며 대화 및 비전 첨부가 가능해집니다.

방식 B: .gguf 파일 로드

  1. 상단 툴바에서 Open Local AI Model (.gguf) 버튼을 클릭합니다.
  2. 탐색기 창에서 다운로드한 .gguf 모델 파일(예: Qwen2.5-Coder 등)을 선택합니다.
  3. 브라우저가 Wllama WebAssembly 가상 머신과 모델 텐서를 즉각 파싱합니다.
  4. 로드가 완료되면 상단 상태 뱃지가 GGUF ready로 켜지며 고속 로컬 코딩 대화가 시작됩니다.
📢 다운로드 시 필수 주의사항 (Git LFS 포인터 오류 방지)
Hugging Face 리포지토리에서 다운로드할 때 파일명을 그대로 마우스 우클릭하여 '다른 이름으로 저장' 하시면 실제 대용량 모델이 아닌 몇 백 바이트 크기의 Git LFS 포인터(텍스트 파일)만 저장되어 로드 시 오류가 발생합니다.

반드시 파일 목록 우측 끝에 위치한 다운로드 아이콘(↓ 화살표 기호)을 직접 클릭하여 최소 수백 MB에서 수 GB에 달하는 온전한 파일을 다운로드하셔야 정상 동작합니다.