云端直连 · Hub 端云协同 · 纯本地推理——把每一毫秒拆开给你看。
设备只做拾音与播放,ASR / LLM / TTS 全部在云端。成本最低,能力上限最高。
ESP32-S3 或微雪(Waveshare)开发板本地只跑唤醒词,音频流式上云。模型可随时换云端旗舰,OTA 只改服务器;代价是延迟随公网波动,断网即失能,语音需上云。
局域网内一台 Hub 承担 ASR、记忆与隐私过滤,重计算按需上云。语音不出户,一台 Hub 带多台终端。
音频先到局域网 Hub:本地完成 ASR 与记忆,原始语音永不出户;LLM 跑本地小模型,或只把脱敏文本发云端换大模型能力。公网往返换成局域网一跳,延迟稳定,断网核心功能仍可用。
整条管线跑在设备本体,零网络依赖。延迟只由算力决定——最稳定、最可预测。
Jetson Orin Nano(67 TOPS,CUDA 生态,3B–7B 流畅)或香橙派 OPi5(RK3588 NPU,性价比路线,1.5B–3B 量化)承载全栈。数据 100% 不离机,无 RTT 无抖动;代价是整机成本与功耗最高。
同一句话,三种架构分别要等多久?
| 指标 | ☁️ 云端 | 🏠 Hub | ⚡ 纯端侧 |
|---|---|---|---|
| ASR 延迟 | 200–400 ms | ~300 ms 实测 | 150–300 ms |
| LLM TTFT | 300–600 ms | 250–500 ms | 200–450 ms |
| 网络开销 | 80–200 ms + 抖动 | ~1 ms 局域网 | 0 ms |
| 断网可用 | ✕ | ✓ 核心可用 | ✓ 完全可用 |
| 语音去向 | 上云 | 不出户 | 不离机 |
| 单终端成本 | 最低 | 终端低 + Hub 摊薄 | 最高 |
| 模型上限 | 云端旗舰 | 本地小模型 + 云增强 | 受本机算力限制 |
* "实测"来自我们在 Intel CPU 级 Hub 上跑通的语音全管线 PoC(热路径稳态);其余为典型区间,随模型大小、量化与网络环境浮动。
按负载类型分三档——越往下对算力、内存带宽和视频引擎的要求越高,价格也越高。价格为 2026 年市场典型价(美元),随内存配置与供货浮动。
纯语言模型,瓶颈是内存带宽。小板卡即可入门,大内存 Mac 可跑 70B 级。
| 设备 | 价格 | 算力 / 内存 | 实测速度 | 备注 |
|---|---|---|---|---|
| Raspberry Pi 5 (8GB) | ~$80 | 纯 CPU · 2–4 TOPS 等效 | ~12 tok/s 小模型 | 生态最成熟,无 NPU |
| Orange Pi 5 Ultra (16GB) | ~$115–145 | RK3588 · 6 TOPS NPU | 10–15 tok/s(NPU) | 性价比路线,软件糙 |
| Radxa Rock 5B (16GB) | $189–229 | RK3588 · 6 TOPS NPU | ≈同上 | 做工好,社区活跃 |
| reComputer RK3588 (8GB) | $199 | RK3588 · 6 TOPS NPU | ≈同上 | 整机盒(含壳/散热) |
| Jetson Orin Nano Super (8GB) | $249 | 67 TOPS · CUDA | 14 tok/s(7B) · prefill 285 | 我们的研发主板 |
| Mac Mini M4 (16–32GB) | $599–999 | 统一内存 120GB/s | 中高 | 大内存装大模型 |
| Mac Mini M4 Pro (48–64GB) | ~$1,400–2,000 | 统一内存 273GB/s | 可跑 70B | 本地大模型最佳性价比 |
单张图理解与检测。除通用板卡外,可外挂 M.2 NPU 加速棒大幅提升视觉吞吐;加速棒需搭配一块主机板(如树莓派)。
| 设备 | 价格 | 算力 | 备注 |
|---|---|---|---|
| Google Coral M.2 (Dual TPU) | $40 | 8 TOPS INT8 | 2026 已 EOL,仅 int8 |
| Hailo-8L(Pi AI Kit) | ~$70 | 13 TOPS | 配树莓派,视觉检测 |
| Hailo-8 M.2 | $80–100 | 26 TOPS | 家用/嵌入式支持好 |
| Hailo-10H(Pi AI HAT+ 2) | $130(整套 $195) | 40 TOPS INT4 | 可跑端侧 LLM |
| Jetson Orin Nano Super | $249 | 67 TOPS | VLM 通吃,有 CUDA |
视频 = 文本 × 多帧,token 量爆炸。除算力外还需硬件视频解码引擎——这是选型关键分水岭。
| 设备 | 价格 | 算力 / 内存 | 备注 |
|---|---|---|---|
| Jetson Orin NX (16GB) | ~$600–900(模组+载板) | 157 TOPS | 集成视频解码,多路摄像头 |
| Hailo-15 视觉处理器 | 相机方案/需集成 | 7–20 TOPS · 多路 4K | 纯 AI 核,需另配 SoC 编解码 |
| Jetson AGX Orin (64GB) | $1,999 | 275 TOPS | 工作站级,可租(CloudJetson) |
| Jetson AGX Thor (128GB) | $3,499 | 2070 FP4 TFLOPS · Blackwell | 机器人/多路视频旗舰 |
| RTX 4090 (24GB) | $2,500–3,700 | — | 我们的研发平台 |
| RTX 5090 (32GB) | $3,700–4,300 | — | 较 4090 快约 33% |
价格来源:NVIDIA / Apple / Seeed / Radxa / Hailo 官方及零售报价(2026)。TOPS 为厂商标称峰值,实际推理速度见「视觉研发」板块实测。
固定输入 · 贪心解码 128 token · 2 次预热 + 20 次测量取中位数。与「硬件方案」板块面向多种硬件不同,本板块为纯技术研发,全部数据实测于单张 RTX 4090。
同一模型、同一张图、同一协议,唯一变量是推理栈:HF transformers(bf16,公平基线)对 llama.cpp(Q4_K_M 量化,部署栈)。
| 模型 | 输入 token * | TTFT bf16 | TTFT Q4 | decode bf16 | decode Q4 | 提速 |
|---|---|---|---|---|---|---|
| Qwen2.5-VL-3B | 418 | 135.5 ms | 115.2 ms | 35.0 tok/s | 275.9 | 7.9× |
| Qwen2-VL-2B | 418 | 65.7 ms | 99.8 ms | 48.5 | 412.9 | 8.5× |
| SmolVLM2-2.2B | 1097 → 100 | 123.0 ms | 60.8 ms | 66.2 | 505.1 | 7.6× |
| InternVL3-2B | 3345 → 1317 | 172.9 ms | 501.6 ms | 52.0 | 438.0 | 8.4× |
| LLaVA-1.6-7B | 2357 → 2895 | 277.0 ms | 571.6 ms | 45.1 | 165.6 | 3.7× |
* 「A → B」表示 transformers 与 llama.cpp 的预处理产生不同视觉 token 数——同一模型在不同框架看到的不是同一张图。跨框架对比必须以实测 input_tokens 为准。
三个结论:① Q4 decode 全线 4–8×,五模型全部落在带宽定标线(104 tok/s × 8B ÷ 参数量)±1% 内;② llama.cpp 视觉编码是短板,视觉 token 多的模型 TTFT 恶化 2–3×;③ 它没有原生视频管线——这两点即二次开发切入点。
Q4_K_M(约 4.5 bit/权重)把每个 token 要搬运的权重字节砍到 1/4——decode 是内存带宽瓶颈,提速近乎线性;关键问题是质量掉不掉。我们用 18 道人工核对答案的图像任务实测。
结论:Q4 量化无质量代价(86% vs 基线 83%,同分数段,速度快 6 倍);1/4 像素的代价高度集中——丢的全是计数与细小物体,颜色 / 动作 / 大字 OCR / 抗幻觉全部保住,适合作端侧常驻快筛档。组合栈(llama.cpp × 1/4 token)实测 TTFT 69ms + 284 tok/s,对基线端到端 7.3×。
10 秒 360p 视频(Big Buck Bunny)经 base64 直接喂给 vLLM 的 OpenAI 兼容接口,Qwen2.5-VL-3B 原生视频输入,无任何手工抽帧。
10 秒视频被抽成约 20 帧、编码为 3018 个视觉 token(约 150 token/帧)——是单图(418)的 7.2 倍。vLLM 只用 2.2 倍的时间吞下它:prefill 斜率约 0.06ms/token,是三个后端中最优(transformers 0.10、llama.cpp 0.16)。20 次测量的 decode 速度波动仅 ±0.15%。
外推到边缘硬件:150 token/帧 × 边缘算力 ≈ 每帧 0.3–0.5s prefill,8 帧视频 TTFT 达 2–4s——这正是抽帧策略与视觉 token 压缩在端侧价值千金的原因,也是本实验室与「硬件方案」板块的接合点。