Mule Agent 部署方案與硬體要求(按團隊規模)

Mule Agent 不是"一個 Java 服務",而是一整套服務:除了 Agent 本體,還包含資料庫、知識圖譜、向量檢索、物件儲存、文件解析等元件,這些才是記憶體和硬碟的大頭。

下面按團隊規模給出參考配置。關鍵原則:

按團隊規模選配置

10 人以內 · 全部服務一臺機器

一臺 8 核 32G 伺服器,雲端大模型,夠用

專案參考配置
伺服器8 核 32G 起(Agent + 資料庫 + 知識圖譜 + 向量檢索 + 物件儲存 + 文字向量化全在同一臺,32G 是起步,人多或文件多建議 64G)
硬碟512G 起(知識庫、聊天記錄、向量索引、媒體檔案都在本地積累)
GPU不需要(文字向量化是 CPU 跑,模型走雲端 API)
模型路線雲端大模型 API(DeepSeek 等),按量付費
適合小團隊試用、跨境電商客服、先跑起來看效果
10–50 人

16 核 64G 起;要不要 GPU 看合規

專案參考配置
伺服器16 核 64G 起,多服務併發穩定;建議把資料庫和向量檢索分機或加快取
硬碟512G 起,知識庫 + 向量索引 + 媒體檔案增長快
GPU預設不需要(雲端 API);資料敏感加 GPU 主機跑 SGLang
模型路線雲端 API 為主;合規要求高 → 加 GPU 跑開源模型
適合多數企業辦公、研發團隊;金融/醫療等有合規要求時走私有

這個規模是分水嶺:沒有強合規就用雲端 API 最省;有合規硬要求,加 GPU 主機切私有。

50–500 人

建議多機分離:資料庫、向量庫、物件儲存各自獨立

專案參考配置
Agent 伺服器8 核 32G(專注 Agent 本體,不混裝其他服務)
資料庫/向量庫資料庫 + 向量檢索 + 知識圖譜 獨立一臺 16 核 64G
物件儲存物件儲存 獨立 4 核 8G + 大容量盤(媒體/文件多時)
硬碟合計 1T 起,按知識庫與媒體增長
GPU走雲端不需要;走私有按模型規模配 GPU 主機
適合集團多子公司、連鎖零售、跨境貿易等多人多部門場景

量大後:如果每天呼叫量很大,私有 SGLang 的邊際成本(電費+折舊)可能低於按量 API——這個規模值得算一筆賬。

500 人以上

建議私有化 + 獨立 GPU 叢集;服務全部拆分

專案參考配置
Agent 叢集多節點水平擴充套件,每節點 16 核 64G;資料庫獨立部署
資料庫/向量庫資料庫 + 向量檢索 + 知識圖譜 各自獨立節點,高可用
物件儲存物件儲存分散式叢集(多節點冗餘)
GPU私有 SGLang 叢集(單卡/多卡,視併發與模型規模)
硬碟TB 級起步,按知識庫與審計留痕增長
適合央國企、金融、醫療、政府等強合規 + 大規模場景

這個規模通常有 IT 團隊,部署和運維我們提供陪跑支援(首次實施 + 1–3 個月陪跑)。

私有本地大模型(SGLang)的 GPU 視訊記憶體參考

如果走私有路線,GPU 視訊記憶體決定能跑多大的模型。下表按 4-bit 量化、約 8K 上下文、單人使用估算:

模型規模視訊記憶體需求(參考)典型顯示卡適合
7B~8B(如 Qwen 7B)約 6~8 GBRTX 4060 Ti 16G / 4070 級查制度、問答類輕任務,效果夠用
14B 級約 10~16 GBRTX 4070 Ti S / 4080 級寫文件、整理表格等日常辦公
32B 級約 20~32 GBRTX 4090 24G(量化)或雙卡接近雲端中檔模型的效果
70B+ 級48 GB 以上雙卡 4090 / A100 級預算充足、要求最高的場景

視訊記憶體為參考值,隨模型版本浮動。上表是行業通用參考——部署前我們會按你的實際文件量和想跑的模型出一配置清單。

兩個會明顯加視訊記憶體的因素,買卡前務必考慮:

因素影響(參考)
長文件 / 長上下文處理合同、標書這類長資料需要 32K 級上下文。小模型(7B 級)多佔 1~2G 影響不大;32B 級可能多佔 8G 以上——上表"單卡 4090 能跑"的結論就不成立了,得上雙卡或更大視訊記憶體。
併發人數多個員工同時提問,每人都要佔一份上下文快取,視訊記憶體佔用按人數往上疊。SGLang 這類推理引擎會做批處理最佳化,但視訊記憶體總量仍是硬上限。

所以上表只適合當入門參考:一個人偶爾查制度,按表選卡沒問題;幾十個員工日常用 + 長文件場景,預算往上提一檔,或者把真實場景發我們——部署前按你們的文件長度和同時使用人數出配置清單,這塊算錯最浪費錢。

雲端 vs 私有,一張表看懂

雲端大模型 API私有本地大模型(SGLang)
初期硬體投入一臺 8 核 32G + 512G 盤起步再加 GPU 主機(數千到數萬,看模型規模)
長期模型成本按 Token 付給 API 供應商,用多少付多少電費 + 硬體折舊,用量大後更省
模型效果直接用雲端旗艦模型,效果最好開源模型弱於雲端旗艦,32B 級可滿足多數辦公任務
資料出內網?提問內容出內網(會話與知識庫仍在本地)完全不出
斷網可用?不可用(雲端 API)可用
適合誰跨境電商客服、普通企業辦公、先試用再說了算的團隊金融、醫療、政府、央國企、研發程式碼涉密團隊

我們的建議

拿不準就先走雲端 API 試用:一臺 8 核 32G + 512G 盤的伺服器/NAS 就能跑起來,讓團隊先用兩週,看員工真實使用頻率和回答質量。確有效果、或合規上有硬要求,再加 GPU 主機切到私有——兩種路線用的是同一套 Mule Agent,切換隻改模型接入地址,資料和技能全部保留,不用推倒重來。

私有路線的誠實提醒:本地開源模型在複雜推理、長文件理解上確實不如雲端旗艦模型。如果你們的場景主要是查制度、問流程、整理格式化文件,32B 級本地模型夠用;如果要求接近 GPT 級別的寫作和推理,要麼接受 API 路線,要麼準備更高預算的 GPU。我們會在部署前按你的真實場景給配置建議,不為了賣硬體推薦超配。

拿不準你們該用哪套配置?

告訴我們團隊規模、主要場景和資料合規要求,我們給一版部署配置建議(含完整硬體清單),不收費。

免費獲取部署配置建議 →