8단계
8단계 — ONNX Runtime Web 브라우저 추론 경계
0회 조회
목차
작은 분류·임베딩·OCR 보조 모델은 서버 대신 브라우저에서 실행할 수 있습니다. 서버 호출과 사용자 데이터 전송을 줄일 수 있지만 모델 다운로드, 메모리, 배터리, 기기별 성능이라는 새로운 비용이 생깁니다.
실행 공급자를 능력으로 선택한다
WebGPU를 무조건 가정하지 않습니다. 시작할 때 지원 여부와 모델 연산자를 확인하고, 가능하면 WebGPU, 그렇지 않으면 WebAssembly, 둘 다 실패하면 서버 API 또는 기능 비활성화로 돌아갑니다. 모델은 화면 첫 진입에 선다운로드하지 않고 사용자의 실제 행동 뒤에 지연 로드합니다.
추론 선택
기능 요청 → WebGPU capability → WASM capability → 서버 fallback
모델 fetch → 크기·해시 검증 → session 생성 → bounded inference
다운로드와 메모리를 예산으로 관리한다
모델 크기, 압축 전 메모리, 첫 추론 시간, 반복 추론 시간을 저사양 모바일에서도 측정합니다. Cache Storage에는 버전과 해시를 키로 두고 새 모델 검증이 끝난 뒤 이전 버전을 정리합니다. 탭이 숨겨지거나 메모리 압박이 발생하면 session을 해제할 수 있어야 합니다.
완료 기준
- 지원하지 않는 브라우저에서 핵심 화면이 계속 열린다.
- 모델은 사용 전까지 다운로드되지 않으며 크기와 무결성을 검증한다.
- WebGPU·WASM·서버 fallback 결과의 허용 오차를 비교한다.
- 모델 전송량과 추론 시간이 정한 예산을 넘으면 기능을 기본 차단한다.
관련 용어: ONNX Runtime Web
이 글에서 만나는 용어
🎉 로컬 LLM · pgvector · RAG 챗봇 만들기 완주를 축하해요
이어서 어떤 걸 배워 볼까요?