[技術教學文]-Jetson Orin NX 16GB 本地端 LLM 部署:Ollama + Open WebUI + RAG 實作教學
| 撰寫/攝影 | 郭俊廷 | ||
| 前情提要 | 上次文章介紹了如何在JETSON Orin NX上執行Ollama,這次來介紹如何使用Ollama + Open WebUI + RAG技術。 https://blog.cavedu.com/2026/03/12/jetson-ollama/ | ||
| 時間 | 1h(看網路速度) | 材料表 | JETSON ORIN系列套件 reComputer Super J4012全配套裝組 (安裝Jetson ORIN NX 16 GB運算模組,含90W電源與Intel AX210 無線網路卡) 鍵盤滑鼠 HDMI線 HDMI螢幕 |
| 成本 | |||
| 難度 | ★★☆☆☆ | ||
Jetson Orin NX 16GB 本地端 LLM 部署:Ollama + RAG 實作教學
前言
近年大型語言模型(LLM)快速發展,許多應用開始從雲端轉向 本地端 AI 推論(Local AI),例如企業內部知識庫、機器人對話系統或智慧設備等。 在邊緣 AI 領域中,NVIDIA Jetson 系列平台提供強大的 GPU 加速能力,使得在本地端執行 LLM 成為可能。本篇文章將示範如何在 NVIDIA Jetson Orin 上部署 本地端大型語言模型,並透過 Ollama 與 Retrieval-Augmented Generation(RAG)技術 建立 AI 知識問答系統。 透過本教學,你將可以在 Jetson 平台上打造自己的 本地端 AI 助手。系統架構
本次架構主要包含三個核心組件: 1️⃣ LLM 推論服務 2️⃣ 知識庫檢索(RAG) 3️⃣ Web UI 操作介面 架構流程如下:
透過 RAG 技術,模型可以結合 外部資料庫或文件,大幅降低 LLM 常見的 幻覺(Hallucination)問題。
測試設備
本次測試設備如下:- 系統平台:Jetson Orin NX 16GB
- 作業系統:NVIDIA JetPack 6.2
- 儲存裝置:NVMe SSD
- LLM 管理工具:Ollama
開啟 Ollama
首先在 Jetson 系統中安裝 Ollama。 參考以下文章安裝或是使用以下指令安裝: https://blog.cavedu.com/2026/03/12/jetson-ollama/curl -fsSL https://ollama.com/install.sh | sh安裝完成後可以用以下指令確認版本:
ollama --version
下載並執行 LLM 模型
接著下載並執行模型,之前有下載過的不會重新下載會直接載入: ollama run gemma3:4b 第一次執行時會下載模型(約 14GB),下載完成後即可開始對話: >>> Hello 本次使用gemma3:4b可以回答繁體中文:
Ollama 支援多種模型,例如:
- Llama
- Gemma
- gpt-oss
建立 Web UI 介面
若希望透過瀏覽器操作 LLM,可搭配 Open WebUI 使用。(不同版本的介面可能略有差異,請依實際畫面自行尋找對應功能位置) 執行 Docker 指令:docker run -d \ --network=host \ -v open-webui:/app/backend/data \ -e OLLAMA_BASE_URL=http://127.0.0.1:11434 \ --name open-webui \ --restart always \ ghcr.io/open-webui/open-webui:main如果之前安裝過並啟動過此docker,他預設是不會自動關閉所以或出現如下錯誤容器已存在之類的訊息,這時候只要打開http://JETSON_IP:8080即可。
接著開啟瀏覽器:
http://JETSON_IP:8080
第一次登入需建立本地帳號。
注意:
- 帳號資料僅保存在本機
- 不會上傳至雲端
- 若忘記密碼可重新建立容器
RAG 技術介紹
RAG(Retrieval-Augmented Generation) 是目前非常重要的 LLM 技術之一。 RAG 的核心概念: 1️⃣ 將文件轉換為向量資料庫 2️⃣ 使用者提問時先搜尋相關文件 3️⃣ 將文件內容提供給 LLM 4️⃣ LLM 根據文件產生回答 優點包括:- 降低 AI 幻覺
- 可使用企業內部資料
- 不需重新訓練模型
Jetson 執行 LLM 的注意事項
在 Jetson 平台執行 LLM 時需注意:記憶體限制
若使用:- Jetson Orin Nano
- Jetson Orin NX 16GB
建議模型大小
| 記憶體 | 建議模型 |
| 8GB | 2B–4B |
| 16GB | 4B–7B |
| 32GB+ | 7B–13B |
Jetson 執行 Ollama + Open WebUI + RAG
Ollama 若要使用 RAG 技術,需要透過 Open WebUI 建立知識庫,讓 LLM 可以參考該知識庫來回答查詢內容。 要建立知識庫,可從側邊選單的「工作區」(如下圖紅框所示)進入。
進入後點選上方選單的「知識庫」,即可進入知識庫管理頁面。
初次使用時尚未建立任何知識庫,請點選右側的「新增知識」,開始匯入檔案建立知識庫。
建立知識庫時需要填寫以下資訊,用以說明該知識庫的用途。
當知識庫名稱與描述填寫完成後,系統會跳轉至知識庫頁面。此時點選右側的「+」按鈕,即可開始上傳檔案或貼上文字,將相關內容匯入知識庫。
本範例使用以下 NVIDIA提供的 PDF 文件進行測試,各位可依據需求上傳適合的資料:
jetson-orin-datasheet-nano-developer-kit-3575392-r2.pdf
https://nvdam.widen.net/s/zkfqjmtds2/jetson-orin-datasheet-nano-developer-kit-3575392-r2
上傳時間會依檔案大小而有所不同。
也可以上傳多個檔案,本範例先以單一檔案進行測試。
完成知識庫建立後,即可將其套用至模型。
點選左上角的「模型」選單,在右側可看到「新增模型」選項,點選後即可建立新模型。
在新增模型頁面中會有多項設定可調整,此處建議先使用預設設定。
接著輸入模型名稱與簡單描述,並選擇基礎模型,本範例選擇先前使用的 gemma3:4b。
[gallery ids="63038,63039"]
最重要的是選擇剛剛建立的知識庫,選擇完成後點選下方「儲存並建立」。
完成後,即可在模型頁面中看到剛建立的模型。
接著從左側選單選擇「新增對話」,並在模型選擇欄中選擇剛建立的模型。
我們再次詢問:「ORIN NANO 是什麼?」
可以看到模型已根據上傳的 PDF 文件內容進行回答,不再出現錯誤資訊(例如誤判為 Google 產品),而是正確且詳細地說明 NVIDIA Jetson Orin Nano Super Developer Kit 是一款小型且高效能的電腦。
這就是 RAG 能有效降低 LLM 幻覺(Hallucination)的原因
留言 💬 (0)
還沒有留言,來當第一個。