SECURE LLM PLATFORM
本地私有化 LLM 应用平台
源代码与会议录音都不出公司。一台服务器即可起步,搭建与运维都由我们负责。
把推理平台、检索平台与使用界面收纳在一台机器上,建设于客户的隔离网络内。本地私有化与客户自有的私有云均可支持,GPU 集群并非前提。
测试用例生成、代码评审、代码补全、基于内部文档的问答、会议纪要与日英中翻译 —— 开发现场与会议中真正会用到的场景,连同使用界面一并实现。
有些现场无法直接使用云端的 AI 服务
并不只是因为有数据无法外发。制定了生成 AI 应用方针的企业约占七成(令和8年版 情報通信白書),但真正能用于业务的企业只有 34.5%(帝国データバンク,2026 年 5 月,约 1 万家)。真正卡住的是下面四点 —— 数据、费用、规程、经验,它们是同时起作用的。
安全策略不允许把源代码、设计文档与会议录音发送给外部的 AI 服务。也有客户合同明文规定开发数据不得出境的情形 —— 能否使用不由技术决定,而由条款决定。
按量计费,用量越大累计越高;使用越是固化,年度预算越难预估,形成“因为有效果所以费用增加”的结构。长时间会议记录这类输入量大的用途,这一影响最为明显。
受法规与内部规程制约,生成 AI 的使用停留在个人试用或有限的验证;由于看不到能在业务中用起来的前景,内部的共识也迟迟形成不了。
公司内部缺少导入经验与对口人才,没有材料判断哪种配置才够实务用;配置过大还是过小,不实际运行一次无从得知。
推进方式与开始所需的时间
自需求访谈至运维支持共 6 道工序 —— 在真机上反复实测,直到确定满足要求的配置,才进入正式运行。
上面 6 道工序都由我们承接,专业工程师的调配与 GPU 的采购也在其内。
先以小型配置做 PoC:把对象业务限定在 1〜2 项,用真实数据测出回答品质与处理时间后再进入正式导入 —— 因此不必在一开始就把前期投资定死。
没有 GPU 集群,实务也能成立
用途只限于“开发支持”与“内部知识与会议”这两个领域,并且推理平台只保留一个。已落地的 3 套(含银行 2 套)全部仍以一台服务器(一台终端)的配置运行。
使用界面、应用与联动层、检索层、推理平台,全部收纳在一台机器内。由于推理平台是共用的,增加用途时无需增加模型 —— 代码评审、测试生成、内部文档检索、纪要与翻译这 4 个用途,均由同一推理平台承接。
若检索精度不足,也可以只替换检索这一层;不必在一开始就做大,随使用人数与用途的增加再扩展配置。部署形态除本地私有化之外,也支持客户自有的私有云。
针对代码生成、代码评审、文档检索、语音识别等用途,分别把候选模型放到真机上比较一轮,实测响应、并发数与输出品质。通用模型与代码专用模型并用的配置也会一并考虑。
未能满足要求的配置,会在开始运行之前调整并重新实测。既不过大也不过小的配置,不经实测无法确定。
把一切都收进隔离网络并不是目的 —— 我们按数据的保密级别,划分出应在其内部处理的部分与可以交给外部云模型的部分。
对交给外部的一侧,除性能与费用之外,我们还会以条款确认数据所在地(是否有境内区域)与是否用于训练,然后协助选型。
适用的业务
最为擅长的是“软件开发支持”与“内部知识与会议”这两个领域。处理越定型、机密性越高、效果越容易衡量的业务,越适合放在隔离网络内;现有的云端使用无需停止。
检索层是向量数据库与嵌入模型,使用界面覆盖对话、文档检索、IDE 联动与会议转写。5〜10 人的开发团队,参考配置为 GPU 2 张、内存 128GB 的 Linux 服务器 1 台。
费用由三部分决定:①硬件(这是前期投资,并非目的) ②模型与软件(以开源为主,可以替换) ③导入与运维支持(我们承接的范围)。日常开销以定额为主,不与使用量成正比。文档再长、会议再久,也不会产生额外计费。
金额随配置与规模变化,因此我们不提供通用价目表。告知我们并发人数、需处理的文档量与响应时间要求,我们会连同所需配置、该配置下的实测值与参考报价一并提供。
要求水准较高的生成,以及需跨越长上下文的推理,不及云端的顶级模型。仅凭开通账号即可在第一天用上顶级模型的便利,也在云端一侧。不相契合的用途我们不会收进隔离网络,而是按两者并用提出方案。
判断的依据并非性能,而是数据所在、费用结构与自主性这三点 —— 这并不是在否定云端。开放模型的许可证由我们在导入时逐一确认,商用使用的可否与条件可以书面提供;即使某个模型停止提供,也能替换为 Gemma、Qwen 等其他开放模型继续使用。
响应时间与并发人数随配置及使用状况变化,我们不作为通用数值公开。告知我们预计的使用人数与用途,我们会提供该条件下的实测值。硬件的采购、搭建与运维由我们负责,但安装场所与内网接入需要客户一方准备。此外,模型是在验证时点选出当时最合适的,因此并非锁定某个型号提供。
它实际运行的场所
银行 2 套、开发团队 1 套,共 3 套在运行;全部不具备云端连接,推理与数据保存都在客户自有的机器内完成。
已落地 3 套的配置与用途
| 案例与用途 | 硬件 | 模型 |
|---|---|---|
| M 公司银行 开发团队 ── 内部文档的检索问答、测试用例生成 | Threadripper PRO 7975WX / RTX 6000 Ada 48GB ×2(工作站 1 台) | Qwen3.6-35B、Qwen3-Coder-30B、BGE-M3(嵌入) |
| M 公司银行 机密会议 ── 纪要的自动生成、日英中实时翻译 | Apple M3 Ultra(统一内存 512GB、80 核 GPU)1 台 | Qwen3.5-35B(纪要)、Qwen3.5-9B(翻译)、Whisper-V3(语音识别) |
| T 公司 开发团队 ── 代码评审、代码补全、设计文档分析 | Ryzen 9 9900X / RTX 5090 32GB(同一配置 2 台) | Qwen3.6-27B |
3 套全部为不具备云端连接的配置(截至 2026 年 8 月)。运行环境为 Ubuntu、Docker、vLLM,仅机密会议这一套为 macOS 的本地配置。银行的那 2 套中,“物理隔离的自有专用机”是客户决定导入的前提条件。我们自身承接的开发项目也在运行同样的配置。
这套配置能够确保的事
NEXT
咨询请联络相关负责人。
只要指定一个对象,我们就会把成果物及其验证报告作为实物呈现出来。
这套方式是否有效,与其听我们讲件数,不如直接看从实际系统中跑出的结果 —— 这是最快的办法。
只需告知选定哪一个对象,即可开始。