工程筆記本 / AI 人工智慧

AI 人工智慧

[技術教學文]-讓 Jetson Orin 看懂世界!Live VLM WebUI 即時視覺 AI 教學

郭 俊廷📅 2026-06-16👁 214
撰寫/攝影 郭俊廷
時間 1H(根據網路速度決定時間) 材料表 JETSON ORIN系列套件 reComputer Super J4012全配套裝組 (安裝Jetson ORIN NX 16 GB運算模組,含90W電源與Intel AX210 無線網路卡) 鍵盤滑鼠 USB攝影機
成本
難度 ★★☆☆☆
Jetson AI 教學|讓 Jetson Orin 看懂世界!Live VLM WebUI 即時視覺 AI 教學

前言

過去在 AI 視覺應用中,我們常見的流程通常是: 「攝影機擷取影像 → 模型辨識 → 顯示結果」 但隨著 Vision Language Model(VLM)技術快速成熟,AI 已不只是「辨識物件」,而是開始具備:
  • 理解場景
  • 分析行為
  • 閱讀文字
  • 回答問題
  • 解讀影像內容
若想進一步了解 Vision Language Model(VLM)的技術原理,可參考 NVIDIA 官方介紹: https://www.nvidia.com/en-us/glossary/vision-language-models/ 而現在,這些能力可以直接在 NVIDIA Jetson 平台上即時執行。 本篇將介紹 NVIDIA Jetson AI Lab 所推出的 Live VLM WebUI,帶你在 Jetson 平台上快速建置: ? 即時攝影機串流 + ? Vision Language Model + ? Web UI 視覺介面 打造真正「看得懂畫面」的 Edge AI 系統。

什麼是 Live VLM WebUI?

Live VLM WebUI 是 NVIDIA Jetson AI Lab 提供的一套開源即時視覺 AI 測試平台,主要特色包含:
  • WebRTC 即時攝影機串流
  • Vision Language Model(VLM)推論
  • 支援 Ollama / vLLM / OpenAI-compatible API
  • 即時 GPU / VRAM / CPU 監控
  • Prompt Editor(即時修改 AI 指令)
  • Web UI 操作介面
簡單來說,Live VLM WebUI 可以將攝影機畫面即時串流給 AI 模型分析,並透過自然語言與影像內容進行互動。

為什麼 Jetson 適合做 VLM?

近年來許多 VLM 模型已開始輕量化,例如:
  • Gemma 3
  • Qwen VL
  • Llama Vision
使得 Jetson Orin 系列已能在 Edge 端進行即時視覺語言推論。 這代表: ✅ 不需上雲端 ✅ 不需高階 GPU ✅ 可直接在本地端分析影像 非常適合:
  • AI 教學
  • 機器人
  • 智慧監控
  • 工業檢測
  • 邊緣 AI 專案

系統需求

支援的設備:

  • Jetson AGX Thor 開發套件
  • Jetson AGX Orin(64GB)
  • Jetson AGX Orin(32GB)
  • Jetson Orin Nano(8GB)

JetPack 版本需求:

  • JetPack 6(L4T r36.x)
  • JetPack 7(L4T r38.x)

儲存空間需求

建議使用 NVMe SSD 作為系統與模型儲存空間:
  • Live VLM WebUI Container 約需 4GB 空間
  • Ollama 本體及 VLM 模型需額外預留數 GB 至數十 GB 空間(依模型大小而定)

Live VLM WebUI 架構概念

整體流程如下: 與傳統VLM最大差異是: Live VLM WebUI 支援「即時串流影像分析」而不是手動上傳圖片。

Step 1:安裝 Ollama

Live VLM WebUI 需要先有 VLM Backend。 本文以 Ollama 作為 Vision Language Model 的推論後端(Backend),並搭配 JetPack 6.2 環境進行測試。  Ollama的相關介紹及詳細安裝說明可以參考以下文章: https://blog.cavedu.com/2026/03/12/jetson-ollama/

安裝 Ollama

首次下載可能需要數分鐘至數十分鐘,實際時間取決於網路速度與模型大小。 
curl -fsSL https://ollama.com/install.sh | sh

下載 Vision 模型

官方推薦先使用較輕量模型:
ollama pull gemma3:4b
其他可用模型:
ollama pull qwen2.5-vl:7b

ollama pull llama3.2-vision:11b
Jetson 平台建議:
平台 建議模型
Orin Nano 8GB 3B~4B
Orin NX 16GB 4B~7B
AGX Orin 7B~11B

Step 2:下載 Live VLM WebUI

git clone https://github.com/nvidia-ai-iot/live-vlm-webui.git
cd live-vlm-webui

Step 3:啟動 Container

./scripts/start_container.sh
系統會:
  • 自動建立 Docker 環境
  • 啟動 WebRTC Server
  • 啟動 Web UI
  • 自動偵測 Ollama API

Step 4:開啟 WebUI

建議使用與 Jetson 位於相同區域網路(LAN)內的電腦,透過瀏覽器遠端存取 Web UI,以獲得較佳的操作體驗與效能。  開啟瀏覽器: https://<Jetson-IP>:8090 例如: https://192.168.1.104:8090 首次開啟時:
  • 需接受 Self-signed SSL 憑證
  • 允許瀏覽器存取 Camera
點選進階,繼續前往網站。 第一次開啟 Live VLM WebUI 時,瀏覽器會要求存取攝影機權限,請選擇「允許」。 這裡如果是使用筆電遠端連線開啟網頁時,可以使用筆電內建的攝影機,或是另外使用USB攝影機皆可。 Live VLM WebUI 啟動完成後,Container 會持續於背景執行。若需要停止服務,可執行:
docker stop live-vlm-webui
若後續需要重新啟動服務,可執行:
docker start live-vlm-webui

Live VLM WebUI 功能介紹

1️⃣ 即時影像串流

透過 WebRTC:
  • 低延遲
  • 高相容性
  • 支援多種 Camera
可直接串流筆電 Webcam 或 USB Camera。

2️⃣ 即時 AI 分析

系統會持續分析攝影機畫面內容,並依照 Prompt 的設定產生對應結果。 按下Start就會開啟攝影機開始分析: 在VLM API Configuration這裡可以先選擇你要執行的VLM的模型,我們使用gemma3:4b本地端模型,當然也可以選擇其他呼叫API的方式。 在第二個Video Source選單這裡可以更改使用的攝影機還有FPS數值,或是可以使用RTSP 串流,這裡使用外接的USB攝影機C270。 以下使用幾個預設的Prompt顯示他辨識的效果:

預設的Prompt 是使用英文的場景描述

當然如果你使用的模型支援中文 也可以使用中文下Prompt  Describe what you see in this image. Prompt跟回答的結果就會顯示在紅框處的地方。 把左邊的選單往下拉可以看到Prompt Editor的部分,在 Prompt Editor 區域中,可以選擇內建的 Prompt 範本,也可以自行編輯 Prompt 內容,以符合不同應用情境。 這裡我修改Prompt成用繁體中文回答,可以看到下方紅框處的回答也變成中文了:

OCR 文字辨識

將Prompt裡的Quick Presets(快速預設)修改成OCR之後可以看到Prompt變成以下說明: Read and transcribe any text visible in the image. 將攝影機對準 Live VLM WebUI 頁面後,可以看到模型成功辨識並顯示畫面中的文字內容。

安全監控

Are there any safety hazards visible? Answer with 'ALERT: description' or 'SAFE'. 當畫面中出現森林火災等潛在危險情境時,模型會回傳 ALERT 訊息。 如果是一般的山上風景未偵測到明顯風險,則會回傳 SAFE。

行為識別

Describe the person's activity and what they are doing. 從辨識結果中可以看到,模型成功判斷畫面中的人物正在騎乘腳踏車。 透過 Live VLM WebUI,我們可以在 Jetson 平台上快速建置具備即時視覺理解能力的 AI 系統。相較於傳統影像辨識只能回答「看到了什麼」,Vision Language Model 更進一步具備「理解畫面內容」的能力。 搭配 Ollama 與本地端模型,不僅能降低雲端服務成本,也能滿足隱私與即時性需求。無論是 AI 教學、智慧監控、機器人開發或邊緣運算應用,Live VLM WebUI 都是一個值得實際體驗的開源專案。 Prompt 可即時修改。這也是 Live VLM WebUI 最大特色之一: 當然還有更多預設的Prompt 可以嘗試,請各位自己去試試看囉。   參考資料: https://www.jetson-ai-lab.com/tutorials/live-vlm-webui/ https://www.jetson-ai-lab.com/tutorials/ollama/ DGX使用Live VLM WebUI影片: https://www.youtube.com/watch?v=KsLwTIrtPn8

相關文章 📎

留言 💬 (0)

還沒有留言,來當第一個。