SECURE LLM PLATFORM

本地私有化 LLM 应用平台

源代码与会议录音都不出公司。一台服务器即可起步,搭建与运维都由我们负责。

OUTPUT #1
隔离网络内执行环境的搭建

把推理平台、检索平台与使用界面收纳在一台机器上,建设于客户的隔离网络内。本地私有化与客户自有的私有云均可支持,GPU 集群并非前提。

OUTPUT #2
实务应用的实现

测试用例生成、代码评审、代码补全、基于内部文档的问答、会议纪要与日英中翻译 —— 开发现场与会议中真正会用到的场景,连同使用界面一并实现。

领域

AI 驱动开发(将 AI 嵌入开发的每一道工序)

适用对象

需要在隔离网络内运行的开发团队与机密会议(最小配置为单台服务器)

关键词
本地私有化 LLM隔离网络定额的费用结构单台服务器配置
01 ISSUE

有些现场无法直接使用云端的 AI 服务

并不只是因为有数据无法外发。制定了生成 AI 应用方针的企业约占七成(令和8年版 情報通信白書),但真正能用于业务的企业只有 34.5%(帝国データバンク,2026 年 5 月,约 1 万家)。真正卡住的是下面四点 —— 数据、费用、规程、经验,它们是同时起作用的。

RISK 01
数据无法外发

安全策略不允许把源代码、设计文档与会议录音发送给外部的 AI 服务。也有客户合同明文规定开发数据不得出境的情形 —— 能否使用不由技术决定,而由条款决定。

RISK 02
费用无法预估

按量计费,用量越大累计越高;使用越是固化,年度预算越难预估,形成“因为有效果所以费用增加”的结构。长时间会议记录这类输入量大的用途,这一影响最为明显。

RISK 03
规程不允许进入正式使用

受法规与内部规程制约,生成 AI 的使用停留在个人试用或有限的验证;由于看不到能在业务中用起来的前景,内部的共识也迟迟形成不了。

RISK 04
判断不出所需配置与效果

公司内部缺少导入经验与对口人才,没有材料判断哪种配置才够实务用;配置过大还是过小,不实际运行一次无从得知。

02 PROCESS

推进方式与开始所需的时间

自需求访谈至运维支持共 6 道工序 —— 在真机上反复实测,直到确定满足要求的配置,才进入正式运行。

STEP 01 需求访谈 掌握现状与保密级别
STEP 02 架构设计 模型选型、硬件配置、安全设计
STEP 03 环境搭建 采购、装机、推理平台的搭建
STEP 04 业务落地 文档整理、检索平台搭建、工具接入
STEP 05 真机验证 响应、并发数与输出品质由工程师实测
STEP 06 运维支持 模型更新、追加用途、运维经验的移交
未达要求 ── 复查模型与配置后重新实测(在正式运行前定型)

上面 6 道工序都由我们承接,专业工程师的调配与 GPU 的采购也在其内。

先以小型配置做 PoC:把对象业务限定在 1〜2 项,用真实数据测出回答品质与处理时间后再进入正式导入 —— 因此不必在一开始就把前期投资定死。

03 STRENGTH

没有 GPU 集群,实务也能成立

用途只限于“开发支持”与“内部知识与会议”这两个领域,并且推理平台只保留一个。已落地的 3 套(含银行 2 套)全部仍以一台服务器(一台终端)的配置运行。

POINT 01
一台服务器内,只放置一个推理平台

使用界面、应用与联动层、检索层、推理平台,全部收纳在一台机器内。由于推理平台是共用的,增加用途时无需增加模型 —— 代码评审、测试生成、内部文档检索、纪要与翻译这 4 个用途,均由同一推理平台承接。

若检索精度不足,也可以只替换检索这一层;不必在一开始就做大,随使用人数与用途的增加再扩展配置。部署形态除本地私有化之外,也支持客户自有的私有云。

一台服务器上自使用界面叠至共用推理平台,4 个用途均由同一推理平台承接的架构图
POINT 02
按用途在真机上实测之后,再确定配置

针对代码生成、代码评审、文档检索、语音识别等用途,分别把候选模型放到真机上比较一轮,实测响应、并发数与输出品质。通用模型与代码专用模型并用的配置也会一并考虑。

未能满足要求的配置,会在开始运行之前调整并重新实测。既不过大也不过小的配置,不经实测无法确定。

按用途在真机上实测候选模型,未达要求则重新实测,据此确定配置的流程图
POINT 03
按保密级别,在隔离网络与外部之间分流

把一切都收进隔离网络并不是目的 —— 我们按数据的保密级别,划分出应在其内部处理的部分与可以交给外部云模型的部分。

对交给外部的一侧,除性能与费用之外,我们还会以条款确认数据所在地(是否有境内区域)与是否用于训练,然后协助选型。

按保密级别判定数据,分流至隔离网络内的自有服务器与外部云模型的图

适用的业务

最为擅长的是“软件开发支持”与“内部知识与会议”这两个领域。处理越定型、机密性越高、效果越容易衡量的业务,越适合放在隔离网络内;现有的云端使用无需停止。

测试用例生成 由需求与接口规格自动生成,提高观点的覆盖度
代码评审 按规则批量执行,统一指摘的粒度
代码补全与生成 自 VSCode 插件直连隔离网络内的推理平台
设计文档分析 核对设计与实现是否一致,减少规格遗漏
基于内部文档的问答 检索设计文档、手册与 FAQ,给出依据后回答
纪要与翻译 会议录音转写、纪要生成与日英中翻译,全部在隔离网络内处理
配置与费用的思路
不做大,只把推理平台共用

检索层是向量数据库与嵌入模型,使用界面覆盖对话、文档检索、IDE 联动与会议转写。5〜10 人的开发团队,参考配置为 GPU 2 张、内存 128GB 的 Linux 服务器 1 台。

费用由三部分决定:①硬件(这是前期投资,并非目的) ②模型与软件(以开源为主,可以替换) ③导入与运维支持(我们承接的范围)。日常开销以定额为主,不与使用量成正比。文档再长、会议再久,也不会产生额外计费。

金额随配置与规模变化,因此我们不提供通用价目表。告知我们并发人数、需处理的文档量与响应时间要求,我们会连同所需配置、该配置下的实测值与参考报价一并提供。

做不到什么
并非所有用途都能得到与云端大模型相同的结果

要求水准较高的生成,以及需跨越长上下文的推理,不及云端的顶级模型。仅凭开通账号即可在第一天用上顶级模型的便利,也在云端一侧。不相契合的用途我们不会收进隔离网络,而是按两者并用提出方案。

判断的依据并非性能,而是数据所在、费用结构与自主性这三点 —— 这并不是在否定云端。开放模型的许可证由我们在导入时逐一确认,商用使用的可否与条件可以书面提供;即使某个模型停止提供,也能替换为 Gemma、Qwen 等其他开放模型继续使用。

响应时间与并发人数随配置及使用状况变化,我们不作为通用数值公开。告知我们预计的使用人数与用途,我们会提供该条件下的实测值。硬件的采购、搭建与运维由我们负责,但安装场所与内网接入需要客户一方准备。此外,模型是在验证时点选出当时最合适的,因此并非锁定某个型号提供。

04 RESULT

它实际运行的场所

银行 2 套、开发团队 1 套,共 3 套在运行;全部不具备云端连接,推理与数据保存都在客户自有的机器内完成。

已落地 3 套的配置与用途

案例与用途 硬件 模型
M 公司银行 开发团队 ── 内部文档的检索问答、测试用例生成Threadripper PRO 7975WX / RTX 6000 Ada 48GB ×2(工作站 1 台)Qwen3.6-35B、Qwen3-Coder-30B、BGE-M3(嵌入)
M 公司银行 机密会议 ── 纪要的自动生成、日英中实时翻译Apple M3 Ultra(统一内存 512GB、80 核 GPU)1 台Qwen3.5-35B(纪要)、Qwen3.5-9B(翻译)、Whisper-V3(语音识别)
T 公司 开发团队 ── 代码评审、代码补全、设计文档分析Ryzen 9 9900X / RTX 5090 32GB(同一配置 2 台)Qwen3.6-27B

3 套全部为不具备云端连接的配置(截至 2026 年 8 月)。运行环境为 Ubuntu、Docker、vLLM,仅机密会议这一套为 macOS 的本地配置。银行的那 2 套中,“物理隔离的自有专用机”是客户决定导入的前提条件。我们自身承接的开发项目也在运行同样的配置。

这套配置能够确保的事

0
向外部的发送 —— 推理与数据保存都在客户自有的机器内完成。
1
不以 GPU 集群为前提,一台即可起步。
3
落地数量 —— 其中 2 套在银行。

NEXT

咨询请联络相关负责人。

只要指定一个对象,我们就会把成果物及其验证报告作为实物呈现出来。

这套方式是否有效,与其听我们讲件数,不如直接看从实际系统中跑出的结果 —— 这是最快的办法。

查看联系方式 →

只需告知选定哪一个对象,即可开始。