智能门锁这两年悄悄完成了一次身份升级,从单纯的”指纹开门”,变成了猫眼、门铃、摄像头三合一的入户安防终端。有人按门铃、有陌生人在门口停留,主人不管在客厅还是在公司,打开手机 APP 就该能立刻看清楚门外发生了什么。
“打开就能看清楚”说起来简单,落到智能门锁这个具体的硬件形态上,工程难度却不小。门锁要靠一块电池撑起半年甚至一年的续航,这意味着芯片和无线模块绝大部分时间都得处于深度休眠状态;可一旦有人按门铃、敲门或者触发异动,又要求这套沉睡中的系统在极短时间内醒过来、连上网、把清晰画面推送到用户手机上,而且全程不能明显拉高功耗。

一. 智能门锁为什么也要传实时视频
这背后对应几类很具体的需求:家庭安防场景下,家人可以远程实时查看门口动态,判断是不是可疑人员;适老化场景下,独居老人可以通过门锁上的紧急按钮一键呼叫,子女或社区能第一时间接通视频了解情况;智慧社区场景下,门锁还要能和小区的门禁、物业平台打通,支持远程开门。这些需求共同指向一件事——门锁不再只是一把锁,而是变成了家庭安全的第一道感知入口。
二. 门锁这个设备形态,卡在哪
坑一:电池续航和”实时”这两个目标天然打架
台灯插着电,可以让摄像头模组和网络模块一直保持在线;门锁不行,大部分家庭不会接受”半年就要拆下来充电”的智能锁。这意味着门锁的芯片和无线模块,绝大部分时间必须处于深度休眠状态,只有检测到有人靠近、按了门铃或者触发异动时才能被唤醒。而用户对体验的要求并不会因为设备在”省电”就降低。从设备被唤醒,到联网、推流、手机上看到清晰画面,这中间的响应速度,直接决定了这套系统在关键时刻能不能真正派上用场。
坑二:跑在资源极其有限的 RTOS 上
不像台灯还能塞进一颗四核处理器配 1GB 内存,门锁这类对功耗和成本都极度敏感的设备,大量采用的是 RAM、ROM 都很有限的轻量级 RTOS 系统。一套为常规 Linux 环境设计的、相对”重”的音视频协议栈,放到这种资源紧张的环境里,轻则挤占本就不多的存储空间,重则直接跑不起来,或者严重拖累本该省电的续航表现。
坑三:装在防盗门上,信号先天就不占优势
门锁的安装位置是固定的、不能挪动的,通常是一扇金属材质的防盗门,这对无线信号本身就是个削弱。不同用户家里的路由器摆放位置、装修结构、墙体厚度又千差万别,导致同一款门锁在不同家庭里的 Wi-Fi 信号强弱差异很大。对门锁来说,弱网不是偶发状况,而是要默认应对的常态。
三. 声网的方案,怎么逐一应对
应对坑一和坑四:低功耗快速唤醒 + 秒级出图
声网给出的量产指标是出图速度小于 1 秒,配合全球范围内小于 400 毫秒的通话延迟,也就是说,从设备被唤醒到用户在手机上看清门外的画面,整个链路被压缩到了用户几乎感知不到等待的程度。这套能力专门针对低功耗设备的唤醒场景做了优化,不是简单把一套通用方案套用过来。
应对坑二:极致轻量化的 SDK
针对门锁这类 RTOS 设备,声网 SDK 的增量体积控制在 400KB 以内,运行时内存占用仅需 1.2MB,这个量级的资源占用,是专门为了能塞进资源极其有限的门锁主控芯片而设计的。同时声网通过 Turnkey 模式,对市场上主流的门锁硬件芯片方案做了官方适配,硬件厂商不需要自己从底层芯片开始一点点调通音视频链路,能明显缩短上线周期。
应对坑三:弱网条件下的编解码优化
面对不同家庭千差万别的 Wi-Fi 信号强度,声网基于编解码算法层面的优化来对抗弱网,尽量让画面在信号不理想的家庭环境里依然保持清晰流畅,声网的连通率指标是超过 99.7%。
怎么接入:两种模式看厂商自己的技术家底
声网给了两条接入路径:如果厂商已经有自己的 IoT 云平台和设备管理系统,只想要纯粹的音视频传输能力,可以走 PaaS 模式,用 SDK 直接集成;如果厂商希望有一套开箱即用的完整方案,包括设备连接管理、事件存储、告警推送这些配套能力,声网也提供低代码的 aPaaS 框架,把这些通常需要厂商自己搭建的周边系统也整合了进来。这个选择本质上是厂商自己评估研发资源之后该做的取舍。
四. 不止会看:远程开门这类”互动”,具体是怎么实现的
门锁这类设备的价值不会停在”看得见”这一层,用户点一下手机就能远程开门、和门外的人对讲,这些”互动”背后其实是两条独立又协同工作的技术通道,而不是靠视频流”顺便”捎带过去的。
看和控是两条不同的通道
视频画面走的是实时音视频(RTC)通道,负责把门口的情况实时传给用户,这部分前面已经讲得比较细了;而”用户按下开锁按钮”这个动作,走的是另一条独立的实时信令(RTM)通道,专门负责把控制指令从手机可靠地送达到门锁设备并触发执行。这两条通道各司其职:一条负责”让人看清楚”,一条负责”把指令说清楚”,配合起来才是完整的远程互动体验,而不是简单把开锁指令塞进视频流里传过去。
指令要的不是”发出去”,而是”送达并执行”
开锁指令如果发出去了但没送达,或者送达了但设备没反应,对用户来说都是同一种糟糕体验——门没开。声网的实时信令给出的指标是全球端到端延迟低于 100 毫秒(99 分位值),同区域往往能做到 50 毫秒以内,同时即便在 70% 丢包的弱网环境下也能保证消息的送达率,配合 99.99% 的运行时间 SLA。放到远程开门这个场景里,意味着这条信令通道本身要比视频通道更”较真”——用户可能可以容忍画面卡顿一下,但很难接受”按了开锁按钮却没反应”。
谁都不希望自己家的门被一条来路不明的指令打开
远程开锁这个动作的安全等级,天然要比”看一眼画面”更高。声网的通讯链路本身受声网私有传输协议、TLS 和 WSS 等协议保护,音视频数据还可以选择用 AES-128、AES-256 这类标准算法做额外加密,密钥由客户自行生成和管理;终端接入则通过 Token 机制做身份认证,只有拿到合法 Token 的用户才能建立连接、下发指令。对硬件厂商来说,这部分安全能力不需要自己从零设计一套加密和鉴权方案,而是可以直接复用声网底层已经做好的这一层。
五. 写在最后
智能门锁做实时视频传输,表面上和摄像头、台灯这类设备是同一件事,但电池供电这个前提,把”低功耗”和”实时”这两个原本就有点矛盾的目标,同时摆在了硬件厂商面前。谁能在续航不打折扣的前提下把响应速度做到用户无感,谁就能在这个家庭安全入口的竞争里占到先机。
如果你正在做一款需要把摄像头画面实时传给用户、同时又要在电池供电条件下把功耗控制到极致的智能硬件,欢迎了解声网的智能门锁/门铃场景方案。
