AI HARDWARE · VOICE PIPELINE

AI 硬件语音交互
三种架构,一张延迟账单

云端直连 · Hub 端云协同 · 纯本地推理——把每一毫秒拆开给你看。

3种部署架构
~300ms本地 ASR 实测
1.45sHub 全管线实测
01 / CLOUD

云端处理

设备只做拾音与播放,ASR / LLM / TTS 全部在云端。成本最低,能力上限最高。

ARCH-01

轻终端 + 全云管线

ESP32-S3 微雪 Touch AMOLED

ESP32-S3微雪(Waveshare)开发板本地只跑唤醒词,音频流式上云。模型可随时换云端旗舰,OTA 只改服务器;代价是延迟随公网波动,断网即失能,语音需上云。

ESP32-S3 云端 ASR 云端 LLM 云端 TTS 设备播放

延迟画像 *

网络上行 + RTT80–200 ms
云端流式 ASR200–400 ms
LLM TTFT(首字延迟)300–600 ms
端到端首响1.0–1.8 s
离线可用
ESP32-S3 MIC SPK 设备示意 · ESP32-S3 开发板
云端管线实测 Demo
VIDEO COMING SOON
02 / HYBRID

端云协同 · Hub 模式

局域网内一台 Hub 承担 ASR、记忆与隐私过滤,重计算按需上云。语音不出户,一台 Hub 带多台终端。

ARCH-02

本地 Hub + 云端增强

终端: ESP32-S3 Hub: RK3588 级

音频先到局域网 Hub:本地完成 ASR 与记忆,原始语音永不出户;LLM 跑本地小模型,或只把脱敏文本发云端换大模型能力。公网往返换成局域网一跳,延迟稳定,断网核心功能仍可用。

ESP32-S3 Hub: ASR + 记忆 本地 LLM / 脱敏上云 TTS 播放

延迟画像 *(含实测)

局域网传输~1 ms
本地流式 ASR(实测)~300 ms
LLM TTFT(本地 3B 级)250–500 ms
端到端首响(实测)~1.45 s
离线可用✓ 核心可用
HUB RK3588 ESP32-S3 ESP32-S3 LAN ~1ms 脱敏文本 语音不出户 组网示意 · 一台 Hub 多终端
Hub 全管线对话 Demo(实测 1.45s)
VIDEO COMING SOON
03 / EDGE

纯端侧推理

整条管线跑在设备本体,零网络依赖。延迟只由算力决定——最稳定、最可预测。

ARCH-03

单机全本地管线

Jetson Orin Nano Orange Pi 5 (RK3588)

Jetson Orin Nano(67 TOPS,CUDA 生态,3B–7B 流畅)或香橙派 OPi5(RK3588 NPU,性价比路线,1.5B–3B 量化)承载全栈。数据 100% 不离机,无 RTT 无抖动;代价是整机成本与功耗最高。

MIC 本地 ASR 本地 LLM (GPU/NPU) 本地 TTS SPK

延迟画像 *

网络传输0 ms
本地流式 ASR150–300 ms
LLM TTFT(Orin / 3B)200–450 ms
端到端首响0.9–1.6 s
离线可用✓ 完全离线
JETSON ORIN NANO 67 TOPS 设备示意 · Jetson Orin Nano
本地推理实测 Demo
VIDEO COMING SOON
04 / BENCHMARK

速度与响应对比

同一句话,三种架构分别要等多久?

端到端首响延迟(用户说完 → 听到第一个字,越短越好)
条形取典型区间中值 · 单位: 秒
☁️ 云端处理1.0 – 1.8 s · 随网络波动
🏠 端云协同 Hub~1.45 s · 实测,稳定
⚡ 纯端侧 · Orin Nano0.9 – 1.6 s · 零网络方差
指标☁️ 云端🏠 Hub⚡ 纯端侧
ASR 延迟200–400 ms~300 ms 实测150–300 ms
LLM TTFT300–600 ms250–500 ms200–450 ms
网络开销80–200 ms + 抖动~1 ms 局域网0 ms
断网可用✓ 核心可用✓ 完全可用
语音去向上云不出户不离机
单终端成本最低终端低 + Hub 摊薄最高
模型上限云端旗舰本地小模型 + 云增强受本机算力限制

* "实测"来自我们在 Intel CPU 级 Hub 上跑通的语音全管线 PoC(热路径稳态);其余为典型区间,随模型大小、量化与网络环境浮动。

05 / SOLUTION

怎么选?

☁️ 云端处理快速出货、压低单机成本、要旗舰模型能力,且场景默认有稳定网络。
🏠 端云协同隐私是卖点、多设备共享算力、断网也要能用——延迟与成本的平衡点。
⚡ 纯端侧完全离线、确定性延迟、数据绝对不离机(工业 / 车载 / 涉密场景)。
06 / HARDWARE MATRIX

硬件选型:文本 · 图像 · 视频

按负载类型分三档——越往下对算力、内存带宽和视频引擎的要求越高,价格也越高。价格为 2026 年市场典型价(美元),随内存配置与供货浮动。

① 文本 · LLM

门槛最低 · 选择最多

纯语言模型,瓶颈是内存带宽。小板卡即可入门,大内存 Mac 可跑 70B 级。

设备价格算力 / 内存实测速度备注
Raspberry Pi 5 (8GB)~$80纯 CPU · 2–4 TOPS 等效~12 tok/s 小模型生态最成熟,无 NPU
Orange Pi 5 Ultra (16GB)~$115–145RK3588 · 6 TOPS NPU10–15 tok/s(NPU)性价比路线,软件糙
Radxa Rock 5B (16GB)$189–229RK3588 · 6 TOPS NPU≈同上做工好,社区活跃
reComputer RK3588 (8GB)$199RK3588 · 6 TOPS NPU≈同上整机盒(含壳/散热)
Jetson Orin Nano Super (8GB)$24967 TOPS · CUDA14 tok/s(7B) · prefill 285我们的研发主板
Mac Mini M4 (16–32GB)$599–999统一内存 120GB/s中高大内存装大模型
Mac Mini M4 Pro (48–64GB)~$1,400–2,000统一内存 273GB/s可跑 70B本地大模型最佳性价比

② 图像 · 单帧 VLM / 视觉

加一根 NPU 加速棒

单张图理解与检测。除通用板卡外,可外挂 M.2 NPU 加速棒大幅提升视觉吞吐;加速棒需搭配一块主机板(如树莓派)。

设备价格算力备注
Google Coral M.2 (Dual TPU)$408 TOPS INT82026 已 EOL,仅 int8
Hailo-8L(Pi AI Kit)~$7013 TOPS配树莓派,视觉检测
Hailo-8 M.2$80–10026 TOPS家用/嵌入式支持好
Hailo-10H(Pi AI HAT+ 2)$130(整套 $195)40 TOPS INT4可跑端侧 LLM
Jetson Orin Nano Super$24967 TOPSVLM 通吃,有 CUDA

③ 视频 · 流式 VLM

需视频引擎 + 大算力

视频 = 文本 × 多帧,token 量爆炸。除算力外还需硬件视频解码引擎——这是选型关键分水岭。

设备价格算力 / 内存备注
Jetson Orin NX (16GB)~$600–900(模组+载板)157 TOPS集成视频解码,多路摄像头
Hailo-15 视觉处理器相机方案/需集成7–20 TOPS · 多路 4K纯 AI 核,需另配 SoC 编解码
Jetson AGX Orin (64GB)$1,999275 TOPS工作站级,可租(CloudJetson)
Jetson AGX Thor (128GB)$3,4992070 FP4 TFLOPS · Blackwell机器人/多路视频旗舰
RTX 4090 (24GB)$2,500–3,700我们的研发平台
RTX 5090 (32GB)$3,700–4,300较 4090 快约 33%
选型关键:纯 NPU 加速棒(Coral / Hailo-8)没有视频编解码引擎——做真实视频产品需再配一颗 SoC 解码,增加成本与延迟。Jetson 把视频解码集成进模组,这正是视频场景选 Jetson 而非便宜加速棒的核心理由。

价格来源:NVIDIA / Apple / Seeed / Radxa / Hailo 官方及零售报价(2026)。TOPS 为厂商标称峰值,实际推理速度见「视觉研发」板块实测。

聊聊你的 AI 硬件方案

从选型、延迟优化到隐私架构落地,欢迎交流。