工程筆記本 / AIoT&邊緣運算

AIoT&邊緣運算

[技術教學文]-Jetson Orin NX 16GB 本地端 LLM 部署:Ollama + Open WebUI + RAG 實作教學

郭 俊廷📅 2026-04-01👁 118
撰寫/攝影 郭俊廷
前情提要 上次文章介紹了如何在JETSON Orin NX上執行Ollama,這次來介紹如何使用Ollama + Open WebUI + RAG技術。 https://blog.cavedu.com/2026/03/12/jetson-ollama/
時間 1h(看網路速度) 材料表 JETSON ORIN系列套件 reComputer Super J4012全配套裝組 (安裝Jetson ORIN NX 16 GB運算模組,含90W電源與Intel AX210 無線網路卡) 鍵盤滑鼠 HDMI線 HDMI螢幕
成本
難度 ★★☆☆☆
  本次使用的設備是reComputer Super J4012 (安裝Jetson ORIN NX 16 GB可以使用Super模式的版本) 當然也可以使用其他JETSON ORIN系列套件 只是支援的模型大小有所不一,請根據您的設備執行適合的模型,目前測試JetPack 6.2 以下安裝方法都是可行的。 如果還沒安裝過、參考支援的設備以及適用的JetPack版本可以參考以下文章: https://blog.cavedu.com/2026/03/12/jetson-ollama/

Jetson Orin NX 16GB 本地端 LLM 部署:Ollama + RAG 實作教學

前言

近年大型語言模型(LLM)快速發展,許多應用開始從雲端轉向 本地端 AI 推論(Local AI),例如企業內部知識庫、機器人對話系統或智慧設備等。 在邊緣 AI 領域中,NVIDIA Jetson 系列平台提供強大的 GPU 加速能力,使得在本地端執行 LLM 成為可能。本篇文章將示範如何在 NVIDIA Jetson Orin 上部署 本地端大型語言模型,並透過 OllamaRetrieval-Augmented Generation(RAG)技術 建立 AI 知識問答系統。 透過本教學,你將可以在 Jetson 平台上打造自己的 本地端 AI 助手

系統架構

本次架構主要包含三個核心組件: 1️⃣ LLM 推論服務 2️⃣ 知識庫檢索(RAG) 3️⃣ Web UI 操作介面 架構流程如下: 透過 RAG 技術,模型可以結合 外部資料庫或文件,大幅降低 LLM 常見的 幻覺(Hallucination)問題

測試設備

本次測試設備如下:
  • 系統平台:Jetson Orin NX 16GB
  • 作業系統:NVIDIA JetPack 6.2
  • 儲存裝置:NVMe SSD
  • LLM 管理工具:Ollama
Jetson Orin 系列具備 GPU ,可有效加速 LLM 推論,非常適合用於 邊緣 AI(Edge AI) 應用。

開啟 Ollama

首先在 Jetson 系統中安裝 Ollama。 參考以下文章安裝或是使用以下指令安裝: https://blog.cavedu.com/2026/03/12/jetson-ollama/
curl -fsSL https://ollama.com/install.sh | sh
安裝完成後可以用以下指令確認版本:
ollama --version

下載並執行 LLM 模型

接著下載並執行模型,之前有下載過的不會重新下載會直接載入: ollama run gemma3:4b 第一次執行時會下載模型(約 14GB),下載完成後即可開始對話: >>> Hello 本次使用gemma3:4b可以回答繁體中文: Ollama 支援多種模型,例如:
  • Llama
  • Gemma
  • gpt-oss
完整模型清單可參考: https://ollama.com/library

建立 Web UI 介面

若希望透過瀏覽器操作 LLM,可搭配 Open WebUI 使用。(不同版本的介面可能略有差異,請依實際畫面自行尋找對應功能位置) 執行 Docker 指令:
docker run -d \

--network=host \

-v open-webui:/app/backend/data \

-e OLLAMA_BASE_URL=http://127.0.0.1:11434 \

--name open-webui \

--restart always \

ghcr.io/open-webui/open-webui:main
如果之前安裝過並啟動過此docker,他預設是不會自動關閉所以或出現如下錯誤容器已存在之類的訊息,這時候只要打開http://JETSON_IP:8080即可。 接著開啟瀏覽器: http://JETSON_IP:8080 第一次登入需建立本地帳號。 注意:
  • 帳號資料僅保存在本機
  • 不會上傳至雲端
  • 若忘記密碼可重新建立容器
這時候我使用gemma3:4b來問ORIN NANO 是甚麼? 他回答明顯有幻覺,把ORIN NANO認為是GOOGLE的裝置。

RAG 技術介紹

RAG(Retrieval-Augmented Generation) 是目前非常重要的 LLM 技術之一。 RAG 的核心概念: 1️⃣ 將文件轉換為向量資料庫 2️⃣ 使用者提問時先搜尋相關文件 3️⃣ 將文件內容提供給 LLM 4️⃣ LLM 根據文件產生回答 優點包括:
  • 降低 AI 幻覺
  • 可使用企業內部資料
  • 不需重新訓練模型

Jetson 執行 LLM 的注意事項

在 Jetson 平台執行 LLM 時需注意:

記憶體限制

若使用:
  • Jetson Orin Nano
  • Jetson Orin NX 16GB
建議選擇 7B 以下模型

建議模型大小

記憶體 建議模型
8GB 2B–4B
16GB 4B–7B
32GB+ 7B–13B

Jetson 執行 Ollama + Open WebUI + RAG

Ollama 若要使用 RAG 技術,需要透過 Open WebUI 建立知識庫,讓 LLM 可以參考該知識庫來回答查詢內容。 要建立知識庫,可從側邊選單的「工作區」(如下圖紅框所示)進入。 進入後點選上方選單的「知識庫」,即可進入知識庫管理頁面。 初次使用時尚未建立任何知識庫,請點選右側的「新增知識」,開始匯入檔案建立知識庫。 建立知識庫時需要填寫以下資訊,用以說明該知識庫的用途。 當知識庫名稱與描述填寫完成後,系統會跳轉至知識庫頁面。此時點選右側的「+」按鈕,即可開始上傳檔案或貼上文字,將相關內容匯入知識庫。 本範例使用以下 NVIDIA提供的 PDF 文件進行測試,各位可依據需求上傳適合的資料: jetson-orin-datasheet-nano-developer-kit-3575392-r2.pdf https://nvdam.widen.net/s/zkfqjmtds2/jetson-orin-datasheet-nano-developer-kit-3575392-r2 上傳時間會依檔案大小而有所不同。 也可以上傳多個檔案,本範例先以單一檔案進行測試。 完成知識庫建立後,即可將其套用至模型。 點選左上角的「模型」選單,在右側可看到「新增模型」選項,點選後即可建立新模型。 在新增模型頁面中會有多項設定可調整,此處建議先使用預設設定。 接著輸入模型名稱與簡單描述,並選擇基礎模型,本範例選擇先前使用的 gemma3:4b。 [gallery ids="63038,63039"] 最重要的是選擇剛剛建立的知識庫,選擇完成後點選下方「儲存並建立」。 完成後,即可在模型頁面中看到剛建立的模型。 接著從左側選單選擇「新增對話」,並在模型選擇欄中選擇剛建立的模型。 我們再次詢問:「ORIN NANO 是什麼?」 可以看到模型已根據上傳的 PDF 文件內容進行回答,不再出現錯誤資訊(例如誤判為 Google 產品),而是正確且詳細地說明 NVIDIA Jetson Orin Nano Super Developer Kit 是一款小型且高效能的電腦。 這就是 RAG 能有效降低 LLM 幻覺(Hallucination)的原因

應用場景

透過 Jetson + LLM + RAG,可以打造多種應用: ? 機器人語音助手 ? 工廠知識庫 AI ? 教學 AI 助理 ? 企業文件搜尋系統 ? 自主移動機器人 由於所有運算都在本地端完成,也能確保 資料隱私與安全性

總結

透過 Jetson Orin NX 16GB + Ollama,現在已經可以在邊緣設備上執行本地端大型語言模型。 再搭配 RAG 技術,即可建立具備知識檢索能力的 AI 系統,大幅提升回答準確度與實用性。 未來在 機器人、智慧設備與工業 AI 領域,這類 Edge LLM 架構將會越來越常見。

參考資料

Ollama https://ollama.com Jetson AI Lab https://www.jetson-ai-lab.com/tutorials/ollama/

相關文章 📎

留言 💬 (0)

還沒有留言,來當第一個。