工程筆記本 / AIoT&邊緣運算

AIoT&邊緣運算

打造不需上網的私人 AI 助理:在 NVIDIA DGX Spark 上部署 GPT-OSS 120B(Ollama × OpenWebUI)

徐 豐智📅 2026-02-03👁 171

前言

對於校園、研究單位或企業內部環境而言,資料隱私與資安往往是首要考量,許多應用場景也無法或不適合將資料傳送至外部雲端服務。因此,能夠在離線環境或內部網路中部署大型語言模型,成為實務上重要的解決方案。 接下來示範在 NVIDIA DGX Spark 上部署 GPT-OSS 120B 等級的大型語言模型,並透過 Ollama 與 OpenWebUI 建立完整的本地推論與互動介面,驗證超大模型在現有硬體條件下的操作流程,提供給大家作為建置私人 AI 系統的參考。
撰寫/攝影 徐豐智
協助測試 郭俊廷
時間 1 小時 (視網路速度) 材料表
難度 ★★☆☆☆

本篇文章使用以下工具作為參考:
  1. NVIDIA DGX Spark:提供為 AI 訓練與推論的硬體環境。
  2. Ollama:提供簡單可控的地端模型管理與 API 層。
  3. OpenWebUI:直覺化的使用者介面,讓使用者透過瀏覽器與 LLM 互動。

NVIDIA DGX Spark 是什麼?

NVIDIA DGX Spark 是 NVIDIA 為生成式 AI 與大型語言模型應用所設計的運算平台,整合 GPU、記憶體(128GB)與包含 CUDA、TensorRT 等 NVIDIA 最佳化推論軟體堆疊。其設計重點在於提供穩定、可重複運作的應用環境,主要用於本地端模型推論、微調與私有化部署。 本文使用相同硬體規格的ASUS Ascent GX10進行測試,廠商比照NVIDIA DGX Spark的框架來製作,執行上沒有遇到不同的操作。 ASUS Ascent GX10

如何安裝 NVIDIA DGX Spark 環境

請參考前一篇文章:ASUS Ascent GX10 安裝系統教學 https://blog.cavedu.com/2025/11/07/asus_ascent_gx10_install/

Ollama 是什麼?

Ollama 是用於本地端執行大型語言模型(LLM)的輕量化應用工具,提供簡單的指令介面來管理與啟動模型,Windows、Linux系統皆可以使用。使用者可快速下載並執行多種開源LLM,不需要自行設定推論框架。搭配 NVIDIA GPU 環境時,Ollama 能充分利用硬體加速能力,適合用於開發、測試與私有化模型服務。

如何安裝 Ollama

開機進入Linux系統Ubuntu後,點選左下角,開啟Terminal,並按照下列步驟依序輸入指令Terminal 1. 下載並安裝 Ollama: curl -fsSL https://ollama.com/install.sh | sh Ollama Finish 2. 執行 GPT-OSS 120B 模型: 執行ollama指定的模型,如果電腦中沒有GPT-OSS 120b模型,會先下載模型再進行推論
註:120b 模型體積龐大,初次下載時間較長且 VRAM 要求較高。若追求流暢度可改用 gpt-oss:20b
ollama run gpt-oss:120b Run Ollama 執行成功後即可在 Terminal 進行互動,按下 Ctrl+D 可離開環境。

Open WebUI 是什麼?

OpenWebUI 是一個開源的 Web 介面系統,用於與本地或私有化部署的大語言模型進行互動。它可以作為 Ollama 等推論服務的前端,提供類似聊天應用的操作體驗,並且支援切換多種模型,包含多種自行下載的開源模型,或是連線ChatGPT等知名雲端AI的API,可以進行對話管理等系統設定介面。主要使用瀏覽器進行UI互動,讓 LLM 能以視覺化方式提供給不同角色的使用者。 Open WebUI Demo

如何安裝 Open WebUI

Open WebUI只是一個使用者介面,他需要連線AI模型才有辦法動作,首先要確認Ollama是否有成功連線運作中,並且至少有一個AI模型可以使用。否則開啟Open WebUI網頁後會沒有AI模型可供選擇。 如果你直接在DGX Spark接上螢幕鍵盤滑鼠進行操作的話,請開啟瀏覽器,並輸入網址11434是Ollama API)   安裝前請確保 Ollama 已成功運作(輸入 http://localhost:11434 顯示 "Ollama is running")。 Ollama Running Check 1. 安裝 Docker 映像檔: 接著開啟Terminal,並按照下列步驟依序輸入指令 sudo docker pull ghcr.io/open-webui/open-webui:ollama Docker Pull 2. 啟動容器: sudo docker run -d \ --name open-webui \ --network host \ --restart unless-stopped \ -e OLLAMA_BASE_URL=http://127.0.0.1:11434 \ -v open-webui:/app/backend/data \ ghcr.io/open-webui/open-webui:main
  3. 連線網頁: 在網頁瀏覽器中連線開啟OpenWebUI 如果是在DGX Spark中開啟瀏覽器,可輸入http://localhost:8080進行連線 (8080目前設定為OpenWebUI的UI)   如果跟DGX Spark在同一個網段中,只要輸入DGX Spark被分配到的ip即可連線http://ip:8080 因為是私人開啟的服務,不需要上網際網路,有在同一個區域網路(網段)即可連線 Open WebUI Login 首先設定管理者帳號密碼,使用者名、Email、密碼可以自行設定,因為是私人開啟的服務,不會做Email認證   登入成功後,左上角可以選擇Ollama的開源模型(gpt-oss:120b),代表Open WebUI與Ollama連線成功。 如果Open WebUI沒有與Ollama連線,則沒有模型可以選擇,請確認前一個網址http://localhost:11434輸入時,網頁是否有出現Ollama is running   接下來即可使用AI模型進行熟悉的對話服務

如果沒有成功開啟Open WebUI,或者想關閉服務,可以嘗試以下幾個指令

  • 關閉服務: sudo docker stop open-webui
  • 開啟服務: sudo docker start open-webui
  • 查看狀態: sudo docker ps -a
    • STATUS 啟動中
    • STATUS 停止中
以上是本次文章的實作分享,歡迎來嘗試開啟自己的私人AI服務。

相關文章 📎

留言 💬 (0)

還沒有留言,來當第一個。