diff --git a/docs/CC码音视频监管系统-技术方案.md b/docs/CC码音视频监管系统-技术方案.md index bf8c914..79683e8 100644 --- a/docs/CC码音视频监管系统-技术方案.md +++ b/docs/CC码音视频监管系统-技术方案.md @@ -64,16 +64,65 @@ | 组件 | 选型 | 版本 | 选型理由 | |------|------|------|---------| | 视频水印 | 自研(DCT+QIM算法) | — | 广电要求自主可控,需定制标准 | -| 视频水印备选 | Digimarc / 海致BD | 商用 | 快速落地可采购商用方案 | +| 视频水印备选 | 海致BD / 数字水印国产方案 | 商用 | 国产商用方案,自主可控,快速落地可采购 | | 音频水印 | 自研(DSSS+心理声学模型) | — | 抗翻录需定制优化 | -| 音频水印备选 | Fraunhofer AudioMark | 商用 | 成熟商用方案,快速验证 | +| 音频水印备选 | 自研(开源算法改进) | — | 基于开源音频水印算法改进,避免闭源外国SDK的数据安全风险 | | 视频指纹 | 自研(关键帧+深度指纹) | — | 需自建指纹库,不依赖第三方 | -| 视频指纹备选 | 腾讯云/字节火山引擎API | SaaS | 快速验证阶段可调用第三方 | +| 视频指纹备选 | 腾讯云/字节火山引擎API | SaaS | 快速验证阶段可调用第三方(数据不出广电云) | | 音频指纹 | 自研(频谱图+Constellation Map) | — | 类Shazam算法,技术成熟可自研 | -| 音频指纹备选 | ACRCloud / Audible Magic | SaaS | 成熟商用音频识别服务 | +| 音频指纹备选 | ACRCloud / Audible Magic | SaaS | 仅用于快速验证,生产环境用自研 | | 视频处理 | FFmpeg | 6.x+ | 开源标准,转码/裁剪/帧提取 | | 音频处理 | librosa / torchaudio | 最新版 | Python音频分析标准库 | +> **数据安全说明**:广电监管系统涉及内容主权,**不使用闭源外国商用SDK**(如Digimarc、Fraunhofer)。原因:①闭源二进制无法审计后门或遥测;②美国/欧盟出口管制风险;③等保三级审查不通过;④水印格式不透明,广电无法制定自主标准。水印技术采用"自研为主、国产商用为辅"策略。 + +**自研开源参考项目**: + +| 技术模块 | 开源项目 | 语言 | License | 说明 | +|---------|---------|------|---------|------| +| **视频水印** | [AlexAgents/VidMark](https://github.com/AlexAgents/VidMark) | Python | MIT | DWT-DCT-QIM算法实现,含嵌入/提取完整流程,抗压缩/噪声/滤波 | +| **视频水印** | [fabriziosalmi/open-video-watermark](https://github.com/fabriziosalmi/open-video-watermark) | Python | MIT | DCT频域水印,Flask Web应用+REST API,含Docker部署 | +| **视频水印** | [JumiRay/video-invisible-watermark](https://github.com/JumiRay/video-invisible-watermark) | Python | MIT | DCT不可见水印,YUV亮度通道嵌入,多帧提取 | +| **音频水印** | [swesterfeld/audiowmark](https://github.com/swesterfeld/audiowmark) | C++ | GPL-3.0 | ⭐569星,Patchwork算法,1024采样帧FFT,成熟可用 | +| **音频水印** | [dmeldrum6/Audio-Watermarking](https://github.com/dmeldrum6/Audio-Watermarking) | JavaScript | — | DSSS+心理声学模型+Bark尺度掩蔽阈值+Reed-Solomon纠错,完整实现 | +| **音频水印** | [corupta/DSSS-watermark](https://gist.github.com/corupta/1ab96d0f2258064a21f76522ab48aac6) | Python | GPL-3.0 | DSSS扩频水印Python脚本,含嵌入/检测完整代码 | +| **音频水印** | [Tranquil-Flow/carnation-radio](https://github.com/Tranquil-Flow/carnation-radio) | Rust/TS | — | Masked DSSS+心理声学掩蔽(Painter-Spanias模型),含抗翻录实测数据 | +| **音频指纹** | [rhthm/audio-fingerprint-engine](https://github.com/rhthm/audio-fingerprint-engine) | Python | — | Constellation Map+组合哈希+PostgreSQL,完整Shazam算法实现 | +| **音频指纹** | [inboxpraveen/Audio-Fingerprint](https://github.com/inboxpraveen/Audio-Fingerprint) | Python | — | 生产级,3秒片段识别,SQLite+WAL,含REST API | +| **音频指纹** | [ankitjosh78/AudioFingerprinting](https://github.com/ankitjosh78/AudioFingerprinting) | Python | — | FastAPI+librosa+scipy,含YouTube导入和麦克风实时识别 | +| **视频指纹** | ResNet50预训练模型 + Milvus向量检索 | Python | Apache-2.0 | torchvision提供ResNet50,Milvus官方提供Python SDK,工程集成即可 | + +> **参考论文**: +> - 视频水印:Chen & Wornell, "Quantization Index Modulation", IEEE Trans. Info. Theory, 2001 +> - 音频水印:Cox et al., "Secure Spread Spectrum Watermarking", 1997;Garcia, "DSSS for Audio", 1999 +> - 心理声学模型:Zwicker & Fastl, "Psychoacoustics: Facts and Models", 1999;ISO/IEC 11172-3 (MPEG-1 Audio) +> - 音频指纹:Avery Wang, "An Industrial-Strength Audio Search Engine", ISMIR 2003(Shazam核心论文) + +**自研难度评估与落地策略**: + +| 技术模块 | 自研难度 | 预估周期 | 难点分析 | 落地策略 | +|---------|---------|---------|---------|---------| +| **视频水印** | ⭐⭐⭐ 中等 | 3~6个月 | DCT+QIM算法是经典学术成果,论文充分;难点在抗裁剪+抗压缩的鲁棒性调优,需大量对抗测试。1~2个硕博背景算法工程师可完成 | **先采购国产商用方案快速集成(3个月),同步自研(6个月),自研版成熟后替换** | +| **音频水印** | ⭐⭐⭐⭐ 较难 | 6~9个月 | DSSS扩频+心理声学模型组合复杂;抗翻录是公认难题,需反复实验调参;心理声学模型需音频信号处理专业背景。建议至少1个音频信号处理博士+1个工程师 | **自研为主,基于开源算法改进**。音频水印抗翻录需持续优化,非一次性开发。不使用闭源外国SDK,避免数据安全风险 | +| **视频指纹** | ⭐⭐ 低 | 2~3个月 | ResNet50是现成模型,关键帧提取用FFmpeg;本质是工程集成而非算法创新。难点在指纹库规模扩大后的检索性能优化 | **直接自研**,1个PyTorch工程师即可 | +| **音频指纹** | ⭐⭐ 低 | 2~3个月 | Shazam算法论文公开20年,实现教程众多;librosa已提供FFT和频谱分析工具;算法不复杂,工程化即可 | **直接自研**,1个Python工程师即可 | + +**双轨落地路线**: + +``` +快速落地(3个月内): + ├── 视频水印 → 采购国产商用方案集成上线(如海致BD) + ├── 音频水印 → 基于开源算法改进,自研MVP上线 + ├── 视频指纹 → 自研MVP上线 + └── 音频指纹 → 自研MVP上线 + +自主可控(6~12个月): + ├── 视频水印 → 自研版替换国产商用方案 + └── 音频水印 → 自研版持续优化抗翻录能力 +``` + +> **核心结论**:指纹技术自研难度低,直接自研;水印技术有一定门槛,采用"先采购国产商用快速落地、同步自研逐步替换"的双轨策略。所有水印技术最终实现自主可控,不依赖闭源外国SDK。 + ### 2.4 AI推理层 | 组件 | 选型 | 版本 | 选型理由 |