想知道公司里部署一个可以供 20-40 人用的开源模型,需要大概怎样的硬件配置,一般会做文档处理,以及一些简单的编程
想知道公司里部署一个可以供 20-40 人用的开源模型,需要大概怎样的硬件配置,一般会做文档处理,以及一些简单的编程
1
owen800q 2h 55m ago via iPhone
5090
|
4
Muze 2h 23m ago
可以搜 技术犬,他们好像专门弄这个静音 AI 机箱,但是价格动不动就 50 到 80 万的,看预算吧,有机房的话,可以去找各大服务器厂家询价,例如惠普,戴尔之类的
|
5
someonesnone 2h 22m ago via Android
感觉得魔改大显存
|
6
gpt5 2h 11m ago
看抖音上有人用 5000 块钱 diy 的丐版硬件部署 dsv4flash ,可以跑到 100tps 以上。
|
7
Integ 2h 5m ago via iPhone
4 张 RTX pro 6000 就够了。
|
8
wu67 2h 3m ago
除非数据有超常规格的保密要求, 不然还不如买套餐...本地跑单是商用电费就够你们喝一壶了
|
9
malusama 2h 2m ago
感觉现在本地部署根本不划算。。
|
11
woscaizi 1h 45m ago
现在 Agent 工具的上下文很大的,会导致 prefill 阶段很耗时。如果是 20-40 人使用绝对不是 4 张 5090 ,6000 就能搞定的
|
13
ttwxdly 1h 27m ago
少说 10 张 5090 。还有内存啥的,一点都不划算。
|
14
hrapunzel 1h 24m ago
deepseek-v4-flash 高精度量化模型,两个 dgx spark 可以跑
|
15
woscaizi 1h 23m ago
部署 deepseek 、glm 、mimimax 之类效果好的开源模型用起来会很好,但不是低成本就能部署下来的。你可以调研下部署 deepseek-v4-flash 需要多少钱,它的部署需求基本是最低的。如果是部署 qwen3.6-35B 级别,需要的资源少,但是任务成功的概率低。
|
16
beefhotpot 1h 7m ago
deepseek-v4-flash ,2 张 rtx pro 6000 可以跑。
|
17
zsj1029 1h 5m ago
h20 141 两张就够了 ds flash 很强,一步到位不要扣扣嗖嗖最后什么也搞不好
|
18
dcatfly 58 mins ago
如果你本身比较了解模型相关的概念,可以参考 https://apxml.com/zh/tools/vram-calculator
如果本身不了解,可以直接拿你的需求问 chatgpt ,再结合上面的做参考 |
20
woscaizi 53 mins ago
可以跑是一回事,能真的用起来是一回事。况且是 20-40 人使用
|
21
Inn0Vat10n 53 mins ago
你要先说预算, 几十万,几百万,几千万,体验是完全不同的
|
22
darksword21 PRO 肯定 rtx pro 6000
|
23
94 38 mins ago
之前收集过一段时间信息,总结时就是 50 万起步最低档,而且只是低可用的状态。所以最后是找阿里谈商务,保密的部分合同上面写清楚就是了。
|
24
wwhc 36 mins ago
1 到 2 张 RTX 6000 + Qwen3.6/3.8 27B + llama.cpp 应该够你们公司用了,不建议用 vLLM ,推理速度可能快些,但输出质量不如 llama.cpp
|
25
edw1n 28 mins ago
当前最具性价比的方案就是 2 台 NVIDIA DGX Spark 来部署 deepseek-v4-flash 。价格可以控制在 8 万以内,基本可以满足 20 人同时使用的性能。
|
26
allinQQQ 7 mins ago
2 台 NVIDIA DGX Spark 部署 deepseek-v4-flash
GB10 性能比较差,双机基本只能 1~4 个并发 |
27
yanest 6 mins ago via Android
我们这边有数据中心用的 5090 货源,8 卡,五十多万,最近又涨了一点。不过性价比很高,他们说的 pro6000 十万多一张没有性价比,如果模型能用 5090 跑起来是当前最优解
|
28
yanest 6 mins ago via Android
五十多是整机
|
29
molvqingtai 2 mins ago
GPT luna 不是免费了吗
|
30
restkhz Just Now
取决于预算。
勉强能跑起来交差的,五位数不到,跑个 Qwen3.6-35B-A3B 还是够的,文档处理,简单编程能做。不过搞好了没几个人想用。 5 位数算力带宽都好点的可以考虑比如还有几个小时就要发布的 Qwen3.8-27B ,能用。跑 Dense 要注意带宽。 好用点的,能长期用的准备差不多 6 位数了。准备将近 200G 的显存吧。 我这有用 H100+vLLM ,4K 上下文并发几十也没毛病。不过跑 Agent 上下文到 100K+明显卡 prefilling 。仅供参考。 |