Mule Agent 部署方案与硬件要求(按团队规模)

Mule Agent 不是"一个 Java 服务",而是一整套服务:除了 Agent 本体,还包含数据库、知识图谱、向量检索、对象存储、文档解析等组件,这些才是内存和硬盘的大头。

下面按团队规模给出参考配置。关键原则:

按团队规模选配置

10 人以内 · 全部服务一台机器

一台 8 核 32G 服务器,云端大模型,够用

项目参考配置
服务器8 核 32G 起(Agent + 数据库 + 知识图谱 + 向量检索 + 对象存储 + 文本向量化全在同一台,32G 是起步,人多或文档多建议 64G)
硬盘512G 起(知识库、聊天记录、向量索引、媒体文件都在本地积累)
GPU不需要(文本向量化是 CPU 跑,模型走云端 API)
模型路线云端大模型 API(DeepSeek 等),按量付费
适合小团队试用、跨境电商客服、先跑起来看效果
10–50 人

16 核 64G 起;要不要 GPU 看合规

项目参考配置
服务器16 核 64G 起,多服务并发稳定;建议把数据库和向量检索分机或加缓存
硬盘512G 起,知识库 + 向量索引 + 媒体文件增长快
GPU默认不需要(云端 API);数据敏感加 GPU 主机跑 SGLang
模型路线云端 API 为主;合规要求高 → 加 GPU 跑开源模型
适合多数企业办公、研发团队;金融/医疗等有合规要求时走私有

这个规模是分水岭:没有强合规就用云端 API 最省;有合规硬要求,加 GPU 主机切私有。

50–500 人

建议多机分离:数据库、向量库、对象存储各自独立

项目参考配置
Agent 服务器8 核 32G(专注 Agent 本体,不混装其他服务)
数据库/向量库数据库 + 向量检索 + 知识图谱 独立一台 16 核 64G
对象存储对象存储 独立 4 核 8G + 大容量盘(媒体/文档多时)
硬盘合计 1T 起,按知识库与媒体增长
GPU走云端不需要;走私有按模型规模配 GPU 主机
适合集团多子公司、连锁零售、跨境贸易等多人多部门场景

量大后:如果每天调用量很大,私有 SGLang 的边际成本(电费+折旧)可能低于按量 API——这个规模值得算一笔账。

500 人以上

建议私有化 + 独立 GPU 集群;服务全部拆分

项目参考配置
Agent 集群多节点水平扩展,每节点 16 核 64G;数据库独立部署
数据库/向量库数据库 + 向量检索 + 知识图谱 各自独立节点,高可用
对象存储对象存储分布式集群(多节点冗余)
GPU私有 SGLang 集群(单卡/多卡,视并发与模型规模)
硬盘TB 级起步,按知识库与审计留痕增长
适合央国企、金融、医疗、政府等强合规 + 大规模场景

这个规模通常有 IT 团队,部署和运维我们提供陪跑支持(首次实施 + 1–3 个月陪跑)。

私有本地大模型(SGLang)的 GPU 显存参考

如果走私有路线,GPU 显存决定能跑多大的模型。下表按 4-bit 量化、约 8K 上下文、单人使用估算:

模型规模显存需求(参考)典型显卡适合
7B~8B(如 Qwen 7B)约 6~8 GBRTX 4060 Ti 16G / 4070 级查制度、问答类轻任务,效果够用
14B 级约 10~16 GBRTX 4070 Ti S / 4080 级写文档、整理表格等日常办公
32B 级约 20~32 GBRTX 4090 24G(量化)或双卡接近云端中档模型的效果
70B+ 级48 GB 以上双卡 4090 / A100 级预算充足、要求最高的场景

显存为参考值,随模型版本浮动。上表是行业通用参考——部署前我们会按你的实际文档量和想跑的模型出一配置清单。

两个会明显加显存的因素,买卡前务必考虑:

因素影响(参考)
长文档 / 长上下文处理合同、标书这类长资料需要 32K 级上下文。小模型(7B 级)多占 1~2G 影响不大;32B 级可能多占 8G 以上——上表"单卡 4090 能跑"的结论就不成立了,得上双卡或更大显存。
并发人数多个员工同时提问,每人都要占一份上下文缓存,显存占用按人数往上叠。SGLang 这类推理引擎会做批处理优化,但显存总量仍是硬上限。

所以上表只适合当入门参考:一个人偶尔查制度,按表选卡没问题;几十个员工日常用 + 长文档场景,预算往上提一档,或者把真实场景发我们——部署前按你们的文档长度和同时使用人数出配置清单,这块算错最浪费钱。

云端 vs 私有,一张表看懂

云端大模型 API私有本地大模型(SGLang)
初期硬件投入一台 8 核 32G + 512G 盘起步再加 GPU 主机(数千到数万,看模型规模)
长期模型成本按 Token 付给 API 供应商,用多少付多少电费 + 硬件折旧,用量大后更省
模型效果直接用云端旗舰模型,效果最好开源模型弱于云端旗舰,32B 级可满足多数办公任务
数据出内网?提问内容出内网(会话与知识库仍在本地)完全不出
断网可用?不可用(云端 API)可用
适合谁跨境电商客服、普通企业办公、先试用再说了算的团队金融、医疗、政府、央国企、研发代码涉密团队

我们的建议

拿不准就先走云端 API 试用:一台 8 核 32G + 512G 盘的服务器/NAS 就能跑起来,让团队先用两周,看员工真实使用频率和回答质量。确有效果、或合规上有硬要求,再加 GPU 主机切到私有——两种路线用的是同一套 Mule Agent,切换只改模型接入地址,数据和技能全部保留,不用推倒重来。

私有路线的诚实提醒:本地开源模型在复杂推理、长文档理解上确实不如云端旗舰模型。如果你们的场景主要是查制度、问流程、整理格式化文档,32B 级本地模型够用;如果要求接近 GPT 级别的写作和推理,要么接受 API 路线,要么准备更高预算的 GPU。我们会在部署前按你的真实场景给配置建议,不为了卖硬件推荐超配。

拿不准你们该用哪套配置?

告诉我们团队规模、主要场景和数据合规要求,我们给一版部署配置建议(含完整硬件清单),不收费。

免费获取部署配置建议 →