Mule Agent 不是"一个 Java 服务",而是一整套服务:除了 Agent 本体,还包含数据库、知识图谱、向量检索、对象存储、文档解析等组件,这些才是内存和硬盘的大头。
下面按团队规模给出参考配置。关键原则:
| 项目 | 参考配置 |
|---|---|
| 服务器 | 8 核 32G 起(Agent + 数据库 + 知识图谱 + 向量检索 + 对象存储 + 文本向量化全在同一台,32G 是起步,人多或文档多建议 64G) |
| 硬盘 | 512G 起(知识库、聊天记录、向量索引、媒体文件都在本地积累) |
| GPU | 不需要(文本向量化是 CPU 跑,模型走云端 API) |
| 模型路线 | 云端大模型 API(DeepSeek 等),按量付费 |
| 适合 | 小团队试用、跨境电商客服、先跑起来看效果 |
| 项目 | 参考配置 |
|---|---|
| 服务器 | 16 核 64G 起,多服务并发稳定;建议把数据库和向量检索分机或加缓存 |
| 硬盘 | 512G 起,知识库 + 向量索引 + 媒体文件增长快 |
| GPU | 默认不需要(云端 API);数据敏感加 GPU 主机跑 SGLang |
| 模型路线 | 云端 API 为主;合规要求高 → 加 GPU 跑开源模型 |
| 适合 | 多数企业办公、研发团队;金融/医疗等有合规要求时走私有 |
这个规模是分水岭:没有强合规就用云端 API 最省;有合规硬要求,加 GPU 主机切私有。
| 项目 | 参考配置 |
|---|---|
| Agent 服务器 | 8 核 32G(专注 Agent 本体,不混装其他服务) |
| 数据库/向量库 | 数据库 + 向量检索 + 知识图谱 独立一台 16 核 64G |
| 对象存储 | 对象存储 独立 4 核 8G + 大容量盘(媒体/文档多时) |
| 硬盘 | 合计 1T 起,按知识库与媒体增长 |
| GPU | 走云端不需要;走私有按模型规模配 GPU 主机 |
| 适合 | 集团多子公司、连锁零售、跨境贸易等多人多部门场景 |
量大后:如果每天调用量很大,私有 SGLang 的边际成本(电费+折旧)可能低于按量 API——这个规模值得算一笔账。
| 项目 | 参考配置 |
|---|---|
| Agent 集群 | 多节点水平扩展,每节点 16 核 64G;数据库独立部署 |
| 数据库/向量库 | 数据库 + 向量检索 + 知识图谱 各自独立节点,高可用 |
| 对象存储 | 对象存储分布式集群(多节点冗余) |
| GPU | 私有 SGLang 集群(单卡/多卡,视并发与模型规模) |
| 硬盘 | TB 级起步,按知识库与审计留痕增长 |
| 适合 | 央国企、金融、医疗、政府等强合规 + 大规模场景 |
这个规模通常有 IT 团队,部署和运维我们提供陪跑支持(首次实施 + 1–3 个月陪跑)。
如果走私有路线,GPU 显存决定能跑多大的模型。下表按 4-bit 量化、约 8K 上下文、单人使用估算:
| 模型规模 | 显存需求(参考) | 典型显卡 | 适合 |
|---|---|---|---|
| 7B~8B(如 Qwen 7B) | 约 6~8 GB | RTX 4060 Ti 16G / 4070 级 | 查制度、问答类轻任务,效果够用 |
| 14B 级 | 约 10~16 GB | RTX 4070 Ti S / 4080 级 | 写文档、整理表格等日常办公 |
| 32B 级 | 约 20~32 GB | RTX 4090 24G(量化)或双卡 | 接近云端中档模型的效果 |
| 70B+ 级 | 48 GB 以上 | 双卡 4090 / A100 级 | 预算充足、要求最高的场景 |
显存为参考值,随模型版本浮动。上表是行业通用参考——部署前我们会按你的实际文档量和想跑的模型出一配置清单。
两个会明显加显存的因素,买卡前务必考虑:
| 因素 | 影响(参考) |
|---|---|
| 长文档 / 长上下文 | 处理合同、标书这类长资料需要 32K 级上下文。小模型(7B 级)多占 1~2G 影响不大;32B 级可能多占 8G 以上——上表"单卡 4090 能跑"的结论就不成立了,得上双卡或更大显存。 |
| 并发人数 | 多个员工同时提问,每人都要占一份上下文缓存,显存占用按人数往上叠。SGLang 这类推理引擎会做批处理优化,但显存总量仍是硬上限。 |
所以上表只适合当入门参考:一个人偶尔查制度,按表选卡没问题;几十个员工日常用 + 长文档场景,预算往上提一档,或者把真实场景发我们——部署前按你们的文档长度和同时使用人数出配置清单,这块算错最浪费钱。
| 云端大模型 API | 私有本地大模型(SGLang) | |
|---|---|---|
| 初期硬件投入 | 一台 8 核 32G + 512G 盘起步 | 再加 GPU 主机(数千到数万,看模型规模) |
| 长期模型成本 | 按 Token 付给 API 供应商,用多少付多少 | 电费 + 硬件折旧,用量大后更省 |
| 模型效果 | 直接用云端旗舰模型,效果最好 | 开源模型弱于云端旗舰,32B 级可满足多数办公任务 |
| 数据出内网? | 提问内容出内网(会话与知识库仍在本地) | 完全不出 |
| 断网可用? | 不可用(云端 API) | 可用 |
| 适合谁 | 跨境电商客服、普通企业办公、先试用再说了算的团队 | 金融、医疗、政府、央国企、研发代码涉密团队 |
拿不准就先走云端 API 试用:一台 8 核 32G + 512G 盘的服务器/NAS 就能跑起来,让团队先用两周,看员工真实使用频率和回答质量。确有效果、或合规上有硬要求,再加 GPU 主机切到私有——两种路线用的是同一套 Mule Agent,切换只改模型接入地址,数据和技能全部保留,不用推倒重来。
告诉我们团队规模、主要场景和数据合规要求,我们给一版部署配置建议(含完整硬件清单),不收费。
免费获取部署配置建议 →