# PrivBox 私有化AI算力盒 — 技术说明 > 基于主私盒(部门共享)与轻私盒(单人工位)技术规格整理 --- ## 一、算力芯片架构 ### 1.1 芯片类型:NPU(国产专用算力芯片) PrivBox 全系列采用**国产专用算力芯片(NPU)**,非 GPU 架构。 | 设备 | 主控CPU | 算力芯片 | 芯片数量 | |------|---------|----------|----------| | **轻私盒** | RISC-V 架构国产CPU | 国产算力芯片 | 1颗 | | **主私盒** | 兆芯 | 国产专用算力芯片 | 4颗 | **NPU 路线的设计优势:** - **合封内存架构**:算力芯片与内存封装为一体(轻私盒32GB、主私盒128GB统一内存),避免GPU架构中CPU↔GPU数据拷贝瓶颈 - **能效比优于GPU**:同等算力下功耗更低,轻私盒整机待机<25dB、满载<30dB,适合办公桌面部署 - **全栈国产化**:国产CPU + 国产NPU,全链路自主可控,满足信创要求 ### 1.2 非GPU架构的依据 | 特征 | GPU方案 | PrivBox方案 | |------|---------|-------------| | 标称单位 | TFLOPS(浮点) | TOPS(整型) | | 内存架构 | HBM独立显存 | 合封统一内存 | | 主控搭配 | x86 + GPU | RISC-V / 兆芯 + NPU | | 产品定位 | 通用计算 | 专用AI推理 | | 生态依赖 | CUDA / ROCm | 国产推理框架 | --- ## 二、算力精度与模型支持 ### 2.1 算力精度 标称算力基于 **INT8** 精度,这是芯片厂商标注 TOPS 的标准方式。 | 设备 | INT8 峰值算力 | BF16 等效算力(估) | 内存 | |------|-------------|-------------------|------| | **轻私盒** | 100 TOPS | 约 25-50 TFLOPS | 32GB合封 + 16GB主机 | | **主私盒** | 400 TOPS | 约 100-200 TFLOPS | 128GB统一 + 64GB主机 | > BF16 算力通常为 INT8 的 1/2 至 1/4,具体取决于芯片架构。 ### 2.2 可运行模型体量 INT8 量化下,1B 参数模型约占 1GB 内存。扣除推理运行时开销(KV cache、上下文缓冲),可用内存约为总内存的 60%-70%: | 设备 | 可用于模型内存 | 可运行模型体量 | 实际配置 | |------|--------------|--------------|---------| | **轻私盒** | 约 20GB | 7B-13B 参数 | 7B对话模型 + 写作 + 摘要 + 语音识别 | | **主私盒** | 约 80-90GB | 14B-70B 参数 | 14B对话模型 + 全模块应用 + 向量检索 | **模型运行能力说明:** - **轻私盒(7B-13B)**:流畅运行7B级对话模型,支持公文写作、文档摘要、语音识别等多应用并行常驻。文档明确标注"7B模型常驻推理满载低于30dB" - **主私盒(14B-70B)**:可运行14B级对话模型为主,支持5-20人并发推理。128GB统一内存为大规模知识库向量检索提供充足空间 ### 2.3 推理性能参考 以7B INT8模型为例(轻私盒): | 指标 | 参考值 | |------|--------| | 输入吞吐 | 约 500-800 tokens/s | | 输出吞吐 | 约 30-60 tokens/s | | 首token延迟 | < 200ms | | 并发支持 | 单人独占 | 以14B INT8模型为例(主私盒,5-20人共享): | 指标 | 参考值 | |------|--------| | 输入吞吐 | 约 2000-4000 tokens/s(4芯片合计) | | 输出吞吐 | 约 80-150 tokens/s | | 首token延迟 | < 300ms | | 并发支持 | 5-20人 | --- ## 三、私有化AI云服务能力 ### 3.1 工作台即私有AI云 PrivBox 部署的 **AI应用工作台** 本质上是一个完整的私有化AI云服务平台,通过浏览器访问,提供以下云端能力: | 云服务能力 | 实现方式 | 轻私盒 | 主私盒 | |-----------|----------|--------|--------| | **AI推理API** | 工作台统一模型调度层,支持对话型/补全型/工作流型/智能体型 | ✅ | ✅ | | **知识库服务** | 向量检索 + 文档索引,支持私有/部门/全单位三级可见范围 | ✅(个人级) | ✅(部门级) | | **应用商店** | 应用分类导航、搜索、收藏、评分、审核上架流程 | ✅(预装) | ✅(支持用户创建) | | **语音识别服务** | 本地ASR引擎,实时语音转写 | ✅(单人) | ✅(多人会议) | | **文档处理服务** | 摘要、翻译、格式转换、脱敏、批量处理 | ✅ | ✅ | | **数据分析服务** | 数据导入、智能分析、报告生成、图表解读 | ✅ | ✅ | | **多租户管理** | 用户账号、角色权限、应用审核、审计日志 | ❌(单用户) | ✅ | ### 3.2 与公有云AI的对比 | 维度 | 公有云AI | PrivBox私有AI云 | |------|---------|-----------------| | 数据安全 | 数据上传至外部服务器 | 数据不出盒,物理隔离 | | 网络依赖 | 必须联网 | 离线可用 | | 使用成本 | 按量计费,长期高昂 | 一次部署,无限制使用 | | 响应延迟 | 受网络影响 | 本地推理,零延迟 | | 合规性 | 数据出境风险 | 满足等保2.0、涉密信息系统分级保护 | | 定制能力 | 受限于平台 | 支持自定义应用、知识库、模型参数 | ### 3.3 私有部署的服务组件 ![AI应用工作台架构](img/workbench-arch.svg) 所有服务组件均在 PrivBox 本地运行,无需外部服务器,无需联网。 --- ## 四、芯片架构与软件生态 ### 4.1 硬件架构 | 层级 | 轻私盒 | 主私盒 | |------|--------|--------| | **主控CPU** | RISC-V 架构国产CPU | 兆芯(x86架构) | | **算力芯片** | 1颗国产NPU | 4颗国产专用NPU | | **内存架构** | 32GB合封 + 16GB LPDDR4X | 128GB统一内存 + 64GB DDR5 | | **存储** | microSD高速卡 | M.2 SATA/NVMe SSD | | **网络** | 千兆网口 | 千兆网口 | | **视频输出** | 4Kp60 HDMI | HDMI 2.1 4K@60Hz | ### 4.2 推理框架 PrivBox 算力芯片配套国产推理框架,支持: - INT8 量化推理(主要运行模式) - BF16/FP16 浮点推理(精度优先场景) - 主流模型架构:LLaMA、Qwen、ChatGLM、Baichuan等 - 向量检索引擎(知识库语义搜索) - 语音识别引擎(实时ASR) ### 4.3 国产化合规 | 维度 | 轻私盒 | 主私盒 | |------|--------|--------| | CPU | RISC-V 国产 | 兆芯国产 | | NPU | 国产算力芯片 | 国产专用算力芯片 | | 操作系统 | 国产Linux | 国产Linux | | 推理框架 | 国产框架 | 国产框架 | | 安全认证 | 等保2.0 | 等保2.0 | | 物理隔离 | ✅ 不联网可用 | ✅ 不联网可用 | 全链路国产化,满足党政机关、国企、军队等信创要求。 --- ## 五、总结 | 核心问题 | 结论 | |---------|------| | 算力基于什么精度? | INT8(TOPS标称标准),BF16约为INT8的1/2至1/4 | | 轻私盒能跑多大模型? | 7B-13B参数模型(INT8量化),32GB合封内存 | | 主私盒能跑多大模型? | 14B-70B参数模型(INT8量化),128GB统一内存 | | 基于GPU还是NPU? | NPU(国产专用算力芯片),非GPU架构 | | 能私布AI云服务吗? | 能,工作台即完整的私有化AI云服务平台 |