Mule Agent 不是"一個 Java 服務",而是一整套服務:除了 Agent 本體,還包含資料庫、知識圖譜、向量檢索、物件儲存、文件解析等元件,這些才是記憶體和硬碟的大頭。
下面按團隊規模給出參考配置。關鍵原則:
| 專案 | 參考配置 |
|---|---|
| 伺服器 | 8 核 32G 起(Agent + 資料庫 + 知識圖譜 + 向量檢索 + 物件儲存 + 文字向量化全在同一臺,32G 是起步,人多或文件多建議 64G) |
| 硬碟 | 512G 起(知識庫、聊天記錄、向量索引、媒體檔案都在本地積累) |
| GPU | 不需要(文字向量化是 CPU 跑,模型走雲端 API) |
| 模型路線 | 雲端大模型 API(DeepSeek 等),按量付費 |
| 適合 | 小團隊試用、跨境電商客服、先跑起來看效果 |
| 專案 | 參考配置 |
|---|---|
| 伺服器 | 16 核 64G 起,多服務併發穩定;建議把資料庫和向量檢索分機或加快取 |
| 硬碟 | 512G 起,知識庫 + 向量索引 + 媒體檔案增長快 |
| GPU | 預設不需要(雲端 API);資料敏感加 GPU 主機跑 SGLang |
| 模型路線 | 雲端 API 為主;合規要求高 → 加 GPU 跑開源模型 |
| 適合 | 多數企業辦公、研發團隊;金融/醫療等有合規要求時走私有 |
這個規模是分水嶺:沒有強合規就用雲端 API 最省;有合規硬要求,加 GPU 主機切私有。
| 專案 | 參考配置 |
|---|---|
| Agent 伺服器 | 8 核 32G(專注 Agent 本體,不混裝其他服務) |
| 資料庫/向量庫 | 資料庫 + 向量檢索 + 知識圖譜 獨立一臺 16 核 64G |
| 物件儲存 | 物件儲存 獨立 4 核 8G + 大容量盤(媒體/文件多時) |
| 硬碟 | 合計 1T 起,按知識庫與媒體增長 |
| GPU | 走雲端不需要;走私有按模型規模配 GPU 主機 |
| 適合 | 集團多子公司、連鎖零售、跨境貿易等多人多部門場景 |
量大後:如果每天呼叫量很大,私有 SGLang 的邊際成本(電費+折舊)可能低於按量 API——這個規模值得算一筆賬。
| 專案 | 參考配置 |
|---|---|
| Agent 叢集 | 多節點水平擴充套件,每節點 16 核 64G;資料庫獨立部署 |
| 資料庫/向量庫 | 資料庫 + 向量檢索 + 知識圖譜 各自獨立節點,高可用 |
| 物件儲存 | 物件儲存分散式叢集(多節點冗餘) |
| GPU | 私有 SGLang 叢集(單卡/多卡,視併發與模型規模) |
| 硬碟 | TB 級起步,按知識庫與審計留痕增長 |
| 適合 | 央國企、金融、醫療、政府等強合規 + 大規模場景 |
這個規模通常有 IT 團隊,部署和運維我們提供陪跑支援(首次實施 + 1–3 個月陪跑)。
如果走私有路線,GPU 視訊記憶體決定能跑多大的模型。下表按 4-bit 量化、約 8K 上下文、單人使用估算:
| 模型規模 | 視訊記憶體需求(參考) | 典型顯示卡 | 適合 |
|---|---|---|---|
| 7B~8B(如 Qwen 7B) | 約 6~8 GB | RTX 4060 Ti 16G / 4070 級 | 查制度、問答類輕任務,效果夠用 |
| 14B 級 | 約 10~16 GB | RTX 4070 Ti S / 4080 級 | 寫文件、整理表格等日常辦公 |
| 32B 級 | 約 20~32 GB | RTX 4090 24G(量化)或雙卡 | 接近雲端中檔模型的效果 |
| 70B+ 級 | 48 GB 以上 | 雙卡 4090 / A100 級 | 預算充足、要求最高的場景 |
視訊記憶體為參考值,隨模型版本浮動。上表是行業通用參考——部署前我們會按你的實際文件量和想跑的模型出一配置清單。
兩個會明顯加視訊記憶體的因素,買卡前務必考慮:
| 因素 | 影響(參考) |
|---|---|
| 長文件 / 長上下文 | 處理合同、標書這類長資料需要 32K 級上下文。小模型(7B 級)多佔 1~2G 影響不大;32B 級可能多佔 8G 以上——上表"單卡 4090 能跑"的結論就不成立了,得上雙卡或更大視訊記憶體。 |
| 併發人數 | 多個員工同時提問,每人都要佔一份上下文快取,視訊記憶體佔用按人數往上疊。SGLang 這類推理引擎會做批處理最佳化,但視訊記憶體總量仍是硬上限。 |
所以上表只適合當入門參考:一個人偶爾查制度,按表選卡沒問題;幾十個員工日常用 + 長文件場景,預算往上提一檔,或者把真實場景發我們——部署前按你們的文件長度和同時使用人數出配置清單,這塊算錯最浪費錢。
| 雲端大模型 API | 私有本地大模型(SGLang) | |
|---|---|---|
| 初期硬體投入 | 一臺 8 核 32G + 512G 盤起步 | 再加 GPU 主機(數千到數萬,看模型規模) |
| 長期模型成本 | 按 Token 付給 API 供應商,用多少付多少 | 電費 + 硬體折舊,用量大後更省 |
| 模型效果 | 直接用雲端旗艦模型,效果最好 | 開源模型弱於雲端旗艦,32B 級可滿足多數辦公任務 |
| 資料出內網? | 提問內容出內網(會話與知識庫仍在本地) | 完全不出 |
| 斷網可用? | 不可用(雲端 API) | 可用 |
| 適合誰 | 跨境電商客服、普通企業辦公、先試用再說了算的團隊 | 金融、醫療、政府、央國企、研發程式碼涉密團隊 |
拿不準就先走雲端 API 試用:一臺 8 核 32G + 512G 盤的伺服器/NAS 就能跑起來,讓團隊先用兩週,看員工真實使用頻率和回答質量。確有效果、或合規上有硬要求,再加 GPU 主機切到私有——兩種路線用的是同一套 Mule Agent,切換隻改模型接入地址,資料和技能全部保留,不用推倒重來。
告訴我們團隊規模、主要場景和資料合規要求,我們給一版部署配置建議(含完整硬體清單),不收費。
免費獲取部署配置建議 →