Files
MyAiDesk/算力盒子/PrivBox_技术说明.md
freedak f7a720204a Update: 将子项目从 submodule 转为完整内容
- 移除 GovAI, nomifun-tauri, 算力盒子 的 submodule 引用
- 添加所有子项目的完整源代码
- 保留原始 .git 为 .git.bak 备份
2026-07-04 19:20:46 +08:00

6.7 KiB
Raw Permalink Blame History

PrivBox 私有化AI算力盒 — 技术说明

基于主私盒(部门共享)与轻私盒(单人工位)技术规格整理


一、算力芯片架构

1.1 芯片类型:NPU(国产专用算力芯片)

PrivBox 全系列采用国产专用算力芯片(NPU,非 GPU 架构。

设备 主控CPU 算力芯片 芯片数量
轻私盒 RISC-V 架构国产CPU 国产算力芯片 1颗
主私盒 兆芯 国产专用算力芯片 4颗

NPU 路线的设计优势:

  • 合封内存架构:算力芯片与内存封装为一体(轻私盒32GB、主私盒128GB统一内存),避免GPU架构中CPU↔GPU数据拷贝瓶颈
  • 能效比优于GPU:同等算力下功耗更低,轻私盒整机待机<25dB、满载<30dB,适合办公桌面部署
  • 全栈国产化:国产CPU + 国产NPU,全链路自主可控,满足信创要求

1.2 非GPU架构的依据

特征 GPU方案 PrivBox方案
标称单位 TFLOPS(浮点) TOPS(整型)
内存架构 HBM独立显存 合封统一内存
主控搭配 x86 + GPU RISC-V / 兆芯 + NPU
产品定位 通用计算 专用AI推理
生态依赖 CUDA / ROCm 国产推理框架

二、算力精度与模型支持

2.1 算力精度

标称算力基于 INT8 精度,这是芯片厂商标注 TOPS 的标准方式。

设备 INT8 峰值算力 BF16 等效算力(估) 内存
轻私盒 100 TOPS 约 25-50 TFLOPS 32GB合封 + 16GB主机
主私盒 400 TOPS 约 100-200 TFLOPS 128GB统一 + 64GB主机

BF16 算力通常为 INT8 的 1/2 至 1/4,具体取决于芯片架构。

2.2 可运行模型体量

INT8 量化下,1B 参数模型约占 1GB 内存。扣除推理运行时开销(KV cache、上下文缓冲),可用内存约为总内存的 60%-70%:

设备 可用于模型内存 可运行模型体量 实际配置
轻私盒 约 20GB 7B-13B 参数 7B对话模型 + 写作 + 摘要 + 语音识别
主私盒 约 80-90GB 14B-70B 参数 14B对话模型 + 全模块应用 + 向量检索

模型运行能力说明:

  • 轻私盒(7B-13B:流畅运行7B级对话模型,支持公文写作、文档摘要、语音识别等多应用并行常驻。文档明确标注"7B模型常驻推理满载低于30dB"
  • 主私盒(14B-70B:可运行14B级对话模型为主,支持5-20人并发推理。128GB统一内存为大规模知识库向量检索提供充足空间

2.3 推理性能参考

以7B INT8模型为例(轻私盒):

指标 参考值
输入吞吐 约 500-800 tokens/s
输出吞吐 约 30-60 tokens/s
首token延迟 < 200ms
并发支持 单人独占

以14B INT8模型为例(主私盒,5-20人共享):

指标 参考值
输入吞吐 约 2000-4000 tokens/s4芯片合计)
输出吞吐 约 80-150 tokens/s
首token延迟 < 300ms
并发支持 5-20人

三、私有化AI云服务能力

3.1 工作台即私有AI云

PrivBox 部署的 AI应用工作台 本质上是一个完整的私有化AI云服务平台,通过浏览器访问,提供以下云端能力:

云服务能力 实现方式 轻私盒 主私盒
AI推理API 工作台统一模型调度层,支持对话型/补全型/工作流型/智能体型
知识库服务 向量检索 + 文档索引,支持私有/部门/全单位三级可见范围 (个人级) (部门级)
应用商店 应用分类导航、搜索、收藏、评分、审核上架流程 (预装) (支持用户创建)
语音识别服务 本地ASR引擎,实时语音转写 (单人) (多人会议)
文档处理服务 摘要、翻译、格式转换、脱敏、批量处理
数据分析服务 数据导入、智能分析、报告生成、图表解读
多租户管理 用户账号、角色权限、应用审核、审计日志 (单用户)

3.2 与公有云AI的对比

维度 公有云AI PrivBox私有AI云
数据安全 数据上传至外部服务器 数据不出盒,物理隔离
网络依赖 必须联网 离线可用
使用成本 按量计费,长期高昂 一次部署,无限制使用
响应延迟 受网络影响 本地推理,零延迟
合规性 数据出境风险 满足等保2.0、涉密信息系统分级保护
定制能力 受限于平台 支持自定义应用、知识库、模型参数

3.3 私有部署的服务组件

AI应用工作台架构

所有服务组件均在 PrivBox 本地运行,无需外部服务器,无需联网。


四、芯片架构与软件生态

4.1 硬件架构

层级 轻私盒 主私盒
主控CPU RISC-V 架构国产CPU 兆芯(x86架构)
算力芯片 1颗国产NPU 4颗国产专用NPU
内存架构 32GB合封 + 16GB LPDDR4X 128GB统一内存 + 64GB DDR5
存储 microSD高速卡 M.2 SATA/NVMe SSD
网络 千兆网口 千兆网口
视频输出 4Kp60 HDMI HDMI 2.1 4K@60Hz

4.2 推理框架

PrivBox 算力芯片配套国产推理框架,支持:

  • INT8 量化推理(主要运行模式)
  • BF16/FP16 浮点推理(精度优先场景)
  • 主流模型架构:LLaMA、Qwen、ChatGLM、Baichuan等
  • 向量检索引擎(知识库语义搜索)
  • 语音识别引擎(实时ASR

4.3 国产化合规

维度 轻私盒 主私盒
CPU RISC-V 国产 兆芯国产
NPU 国产算力芯片 国产专用算力芯片
操作系统 国产Linux 国产Linux
推理框架 国产框架 国产框架
安全认证 等保2.0 等保2.0
物理隔离 不联网可用 不联网可用

全链路国产化,满足党政机关、国企、军队等信创要求。


五、总结

核心问题 结论
算力基于什么精度? INT8TOPS标称标准),BF16约为INT8的1/2至1/4
轻私盒能跑多大模型? 7B-13B参数模型(INT8量化),32GB合封内存
主私盒能跑多大模型? 14B-70B参数模型(INT8量化),128GB统一内存
基于GPU还是NPU NPU(国产专用算力芯片),非GPU架构
能私布AI云服务吗? 能,工作台即完整的私有化AI云服务平台