f7a720204a
- 移除 GovAI, nomifun-tauri, 算力盒子 的 submodule 引用 - 添加所有子项目的完整源代码 - 保留原始 .git 为 .git.bak 备份
167 lines
6.7 KiB
Markdown
167 lines
6.7 KiB
Markdown
# PrivBox 私有化AI算力盒 — 技术说明
|
||
|
||
> 基于主私盒(部门共享)与轻私盒(单人工位)技术规格整理
|
||
|
||
---
|
||
|
||
## 一、算力芯片架构
|
||
|
||
### 1.1 芯片类型:NPU(国产专用算力芯片)
|
||
|
||
PrivBox 全系列采用**国产专用算力芯片(NPU)**,非 GPU 架构。
|
||
|
||
| 设备 | 主控CPU | 算力芯片 | 芯片数量 |
|
||
|------|---------|----------|----------|
|
||
| **轻私盒** | RISC-V 架构国产CPU | 国产算力芯片 | 1颗 |
|
||
| **主私盒** | 兆芯 | 国产专用算力芯片 | 4颗 |
|
||
|
||
**NPU 路线的设计优势:**
|
||
|
||
- **合封内存架构**:算力芯片与内存封装为一体(轻私盒32GB、主私盒128GB统一内存),避免GPU架构中CPU↔GPU数据拷贝瓶颈
|
||
- **能效比优于GPU**:同等算力下功耗更低,轻私盒整机待机<25dB、满载<30dB,适合办公桌面部署
|
||
- **全栈国产化**:国产CPU + 国产NPU,全链路自主可控,满足信创要求
|
||
|
||
### 1.2 非GPU架构的依据
|
||
|
||
| 特征 | GPU方案 | PrivBox方案 |
|
||
|------|---------|-------------|
|
||
| 标称单位 | TFLOPS(浮点) | TOPS(整型) |
|
||
| 内存架构 | HBM独立显存 | 合封统一内存 |
|
||
| 主控搭配 | x86 + GPU | RISC-V / 兆芯 + NPU |
|
||
| 产品定位 | 通用计算 | 专用AI推理 |
|
||
| 生态依赖 | CUDA / ROCm | 国产推理框架 |
|
||
|
||
---
|
||
|
||
## 二、算力精度与模型支持
|
||
|
||
### 2.1 算力精度
|
||
|
||
标称算力基于 **INT8** 精度,这是芯片厂商标注 TOPS 的标准方式。
|
||
|
||
| 设备 | INT8 峰值算力 | BF16 等效算力(估) | 内存 |
|
||
|------|-------------|-------------------|------|
|
||
| **轻私盒** | 100 TOPS | 约 25-50 TFLOPS | 32GB合封 + 16GB主机 |
|
||
| **主私盒** | 400 TOPS | 约 100-200 TFLOPS | 128GB统一 + 64GB主机 |
|
||
|
||
> BF16 算力通常为 INT8 的 1/2 至 1/4,具体取决于芯片架构。
|
||
|
||
### 2.2 可运行模型体量
|
||
|
||
INT8 量化下,1B 参数模型约占 1GB 内存。扣除推理运行时开销(KV cache、上下文缓冲),可用内存约为总内存的 60%-70%:
|
||
|
||
| 设备 | 可用于模型内存 | 可运行模型体量 | 实际配置 |
|
||
|------|--------------|--------------|---------|
|
||
| **轻私盒** | 约 20GB | 7B-13B 参数 | 7B对话模型 + 写作 + 摘要 + 语音识别 |
|
||
| **主私盒** | 约 80-90GB | 14B-70B 参数 | 14B对话模型 + 全模块应用 + 向量检索 |
|
||
|
||
**模型运行能力说明:**
|
||
|
||
- **轻私盒(7B-13B)**:流畅运行7B级对话模型,支持公文写作、文档摘要、语音识别等多应用并行常驻。文档明确标注"7B模型常驻推理满载低于30dB"
|
||
- **主私盒(14B-70B)**:可运行14B级对话模型为主,支持5-20人并发推理。128GB统一内存为大规模知识库向量检索提供充足空间
|
||
|
||
### 2.3 推理性能参考
|
||
|
||
以7B INT8模型为例(轻私盒):
|
||
|
||
| 指标 | 参考值 |
|
||
|------|--------|
|
||
| 输入吞吐 | 约 500-800 tokens/s |
|
||
| 输出吞吐 | 约 30-60 tokens/s |
|
||
| 首token延迟 | < 200ms |
|
||
| 并发支持 | 单人独占 |
|
||
|
||
以14B INT8模型为例(主私盒,5-20人共享):
|
||
|
||
| 指标 | 参考值 |
|
||
|------|--------|
|
||
| 输入吞吐 | 约 2000-4000 tokens/s(4芯片合计) |
|
||
| 输出吞吐 | 约 80-150 tokens/s |
|
||
| 首token延迟 | < 300ms |
|
||
| 并发支持 | 5-20人 |
|
||
|
||
---
|
||
|
||
## 三、私有化AI云服务能力
|
||
|
||
### 3.1 工作台即私有AI云
|
||
|
||
PrivBox 部署的 **AI应用工作台** 本质上是一个完整的私有化AI云服务平台,通过浏览器访问,提供以下云端能力:
|
||
|
||
| 云服务能力 | 实现方式 | 轻私盒 | 主私盒 |
|
||
|-----------|----------|--------|--------|
|
||
| **AI推理API** | 工作台统一模型调度层,支持对话型/补全型/工作流型/智能体型 | ✅ | ✅ |
|
||
| **知识库服务** | 向量检索 + 文档索引,支持私有/部门/全单位三级可见范围 | ✅(个人级) | ✅(部门级) |
|
||
| **应用商店** | 应用分类导航、搜索、收藏、评分、审核上架流程 | ✅(预装) | ✅(支持用户创建) |
|
||
| **语音识别服务** | 本地ASR引擎,实时语音转写 | ✅(单人) | ✅(多人会议) |
|
||
| **文档处理服务** | 摘要、翻译、格式转换、脱敏、批量处理 | ✅ | ✅ |
|
||
| **数据分析服务** | 数据导入、智能分析、报告生成、图表解读 | ✅ | ✅ |
|
||
| **多租户管理** | 用户账号、角色权限、应用审核、审计日志 | ❌(单用户) | ✅ |
|
||
|
||
### 3.2 与公有云AI的对比
|
||
|
||
| 维度 | 公有云AI | PrivBox私有AI云 |
|
||
|------|---------|-----------------|
|
||
| 数据安全 | 数据上传至外部服务器 | 数据不出盒,物理隔离 |
|
||
| 网络依赖 | 必须联网 | 离线可用 |
|
||
| 使用成本 | 按量计费,长期高昂 | 一次部署,无限制使用 |
|
||
| 响应延迟 | 受网络影响 | 本地推理,零延迟 |
|
||
| 合规性 | 数据出境风险 | 满足等保2.0、涉密信息系统分级保护 |
|
||
| 定制能力 | 受限于平台 | 支持自定义应用、知识库、模型参数 |
|
||
|
||
### 3.3 私有部署的服务组件
|
||
|
||

|
||
|
||
所有服务组件均在 PrivBox 本地运行,无需外部服务器,无需联网。
|
||
|
||
---
|
||
|
||
## 四、芯片架构与软件生态
|
||
|
||
### 4.1 硬件架构
|
||
|
||
| 层级 | 轻私盒 | 主私盒 |
|
||
|------|--------|--------|
|
||
| **主控CPU** | RISC-V 架构国产CPU | 兆芯(x86架构) |
|
||
| **算力芯片** | 1颗国产NPU | 4颗国产专用NPU |
|
||
| **内存架构** | 32GB合封 + 16GB LPDDR4X | 128GB统一内存 + 64GB DDR5 |
|
||
| **存储** | microSD高速卡 | M.2 SATA/NVMe SSD |
|
||
| **网络** | 千兆网口 | 千兆网口 |
|
||
| **视频输出** | 4Kp60 HDMI | HDMI 2.1 4K@60Hz |
|
||
|
||
### 4.2 推理框架
|
||
|
||
PrivBox 算力芯片配套国产推理框架,支持:
|
||
|
||
- INT8 量化推理(主要运行模式)
|
||
- BF16/FP16 浮点推理(精度优先场景)
|
||
- 主流模型架构:LLaMA、Qwen、ChatGLM、Baichuan等
|
||
- 向量检索引擎(知识库语义搜索)
|
||
- 语音识别引擎(实时ASR)
|
||
|
||
### 4.3 国产化合规
|
||
|
||
| 维度 | 轻私盒 | 主私盒 |
|
||
|------|--------|--------|
|
||
| CPU | RISC-V 国产 | 兆芯国产 |
|
||
| NPU | 国产算力芯片 | 国产专用算力芯片 |
|
||
| 操作系统 | 国产Linux | 国产Linux |
|
||
| 推理框架 | 国产框架 | 国产框架 |
|
||
| 安全认证 | 等保2.0 | 等保2.0 |
|
||
| 物理隔离 | ✅ 不联网可用 | ✅ 不联网可用 |
|
||
|
||
全链路国产化,满足党政机关、国企、军队等信创要求。
|
||
|
||
---
|
||
|
||
## 五、总结
|
||
|
||
| 核心问题 | 结论 |
|
||
|---------|------|
|
||
| 算力基于什么精度? | INT8(TOPS标称标准),BF16约为INT8的1/2至1/4 |
|
||
| 轻私盒能跑多大模型? | 7B-13B参数模型(INT8量化),32GB合封内存 |
|
||
| 主私盒能跑多大模型? | 14B-70B参数模型(INT8量化),128GB统一内存 |
|
||
| 基于GPU还是NPU? | NPU(国产专用算力芯片),非GPU架构 |
|
||
| 能私布AI云服务吗? | 能,工作台即完整的私有化AI云服务平台 |
|