AIoT&邊緣運算華碩 ASUS UGen300 USB AI 加速器 - 掛載Ollama語言模型篇
作者:子賢
購買商品傳送門–超連結
簡介
在上一篇文章中,我們為 UGen300 USB AI 加速器安裝了驅動與更新韌體,接著本文將逐步說明如何在 Windows 11 環境下,使用 hailo-ollama 應用程式,下載大型語言模型並在加速器上載入與運行,建立與 Ollama 相容的 API 伺服器。
文中使用的硬體
帶有 USB-C 10Gbps 介面的 Windows 11 電腦主機
ASUS UGen300 USB AI 加速器
測試系統版本
Windows 11 25H2
啟動 hailo-ollama
hailo-ollama 是 Hailo 官方提供的推理後端,與 Ollama 相容,所以只要是原本就可以跟 Ollama 串接的應用程式,如 LangChain 與 OpenWebUI 等,都可以串接使用。
在開始列表搜尋 命令提示字元,找到後在右側選單中點擊 以系統管理員身分開啟。如果以一般身分開啟的話,後續的程式可能會因為權限不足而無法將檔案寫入硬碟。
開啟後會彈出如下圖的命令提示字元視窗。
使用 cd 指令將路徑移動到前面安裝好的 HailoRT 路徑下。
cd "C:\Program Files\HailoRT\bin"
然後就能用以下指令執行 hailo-ollama,執行後看到如圖片中所展示的 Server running on port 8000,就代表 hailo-ollama 已經正常啟動,正在 8000 連接埠上運行。後續的操作需要保持 hailo-ollama 運行才能正常執行,所以先不要把這個視窗關閉。
hailo-ollama.exe
第一次執行後應該會彈出 Windows 安全性視窗,詢問是否要允許公開與私人網路存取 hailo-ollama,這邊選擇允許即可,如果想修改這個設定,可以到開始功能表中的 設定→隱私與安全性→Windows安全性→防火牆與網路防護→允許應用程式通過防火牆 中進行調整。
下載模型
hailo-ollama 啟動後,再次在開始列表搜尋 命令提示字元,找到後在右側選單中點擊 以系統管理員身分開啟,開啟一個新的命令提示字元。
這邊會使用 Windows 11 內建的 curl 指令,發送 HTTP GET 請求到 hailo-ollama 來獲取可用的模型清單。指令中的 -s 是靜音模式 (slient mode) 的縮寫,會隱藏傳送請求時的進度條。最後的網址則是代表發送請求的目標,這裡用的是 hailo-ollama 伺服器中 list 端點,可以取得可用的模型清單。
在執行後就會像下圖一樣顯示所有 hailo-ollama 能夠使用的模型,有 DeepSeek R1、llama 3.2、Qwen 等。如果沒有回應的話可能是 hailo-ollama 沒有啟動,參考前面的 啟動 hailo-ollama 步驟將它啟動後再次執行應該會正常回覆。
curl -s http://localhost:8000/hailo/v1/list
當決定好要下載哪個模型後,可以使用 curl 指令發送請求,讓 hailo-ollama 把模型檔案下載到電腦上,這邊以 qwen3:1.7b 為例,如果想要使用前面清單中的其他模型,將指令中的 qwen3:1.7b 替換成其他模型名稱即可。
curl -s http://localhost:8000/api/pull -H "Content-Type: application/json" -d "{ \"model\": \"qwen3:1.7b\", \"stream\" : true }"
當看到 {"status":"success"} 時,就代表模型已經下載完成。
與模型對話
當模型下載完成後,就能使用 curl 指令發送請求,與模型進行對話。執行指令後,模型會被載入到加速器上並開始推論,並以串流 (streaming) 的方式逐字回覆。
如果一直都沒有回應的話可能是 hailo-ollama 沒有啟動,參考前面的 啟動 hailo-ollama 步驟將它啟動後再次執行應該會正常回覆。
curl -s http://localhost:8000/api/chat -H "Content-Type: application/json" -d "{\"model\": \"qwen3:1.7b\", \"messages\": [{\"role\": \"user\", \"content\": \"Why sky is blue?\"}]}"
執行時在 hailo-ollama 的命令提示字元視窗也會顯示相關的訊息。
如果模型還沒有下載、名字打錯或是不在清單上的話,會回傳 {"error":"model 'xxx' not found"},回到 下載模型 步驟下載對應的模型或是將名字更正即可正常執行。
結論
透過以上步驟,我們在 Windows 11 環境下使用 hailo-ollama 程式下載了大型語言模型,並將其載入 UGen300 USB AI 加速器中運行,建立起在本地端與大型語言模型對話的 API 伺服器。在下一篇文章中,我們將會安裝 Open WebUI 並讓它連線到剛建立的 API 伺服器,簡化與大語言模型對話的過程。
參考文件
華碩 ASUS UGen300 8GB 產品頁面:https://www.asus.com/tw/motherboards-components/ai-accelerator/ugen/ugen300-usb-8g/
Hailo Model Zoo GenAI Github:
https://github.com/hailo-ai/hailo_model_zoo_genai
留言 💬 (0)
還沒有留言,來當第一個。