最近,海外科技圈被一只机器人鸭子刷屏了。它叫 Microduck,由 Hugging Face 旗下的机器人公司 Pollen Robotics 推出,8 月底开放预售,价格 399 美元,计划在 2026 年圣诞节前发货。短短几周内,从 Hacker News 到各大科技媒体,几乎都在讨论这只”会走路、会抓东西、还有点笨拙可爱”的小鸭子。
一. Microduck 是什么,为什么会火
抛开”鸭子”这个讨喜的外形,Microduck 本质上是一台面向”具身智能”(physical AI)实验和教育场景的双足机器人。它身高 25 厘米,重量不到 800 克,搭载 Rockchip RK3566 四核处理器和一颗 AI 加速器,配合 1GB 内存、32GB 存储,通过 Wi-Fi 和蓝牙联网。机身上有 15 个自由度的电机,支撑它完成走路、转身、抓握等动作;此外还配备了广角摄像头、8×8 ToF 激光雷达、两颗惯性测量单元(IMU),以及一张可以抓取小物件的关节化”嘴巴”。开箱即可运行 7 个预训练动作,比如把袜子捡起来放进箱子里。
真正让 Microduck 在开发者圈子里传开的,是它背后的软件逻辑:整套控制、仿真、强化学习训练和”仿真到现实”(sim-to-real)部署的工具链都基于开源 Rust 编写,任何人都可以在仿真环境里训练一套新动作,再把它部署到实体机器人上。换句话说,Microduck 卖的不只是一台硬件,而是一个”可以被教会新技能”的物理 AI 学习平台。
这也决定了它覆盖的人群:机器人爱好者、具身智能研究者、AI 教育场景的老师和学生,以及想要一台低门槛”实验台”来验证运动控制和强化学习算法的独立开发者。对这批人来说,Microduck 的价值不在于陪伴或娱乐,而在于它把过去需要实验室级别预算才能碰到的”物理 AI”研究,压缩进了一台 399 美元、开箱即用的桌面级设备里。
二. 一个容易被忽略的细节:它其实”听得见”,却好像不太会”说话”
翻看 Microduck 的硬件清单,会发现一个有意思的地方:它配备了麦克风和扬声器。也就是说,从硬件层面看,它具备语音输入和输出的物理基础。
但从目前官方公开展示的能力来看,Microduck 的”声音”更多停留在预设音效层面——比如模拟鸭叫。至少截至目前,还没有看到它像语音助手那样,具备”听懂一句话、理解语境、给出连贯回应”的原生对话能力。它的主要人机交互方式,仍然是配套的游戏手柄操作和视觉、动作反馈。
这其实并不是 Microduck 一家的短板,而是当下相当一批 AI 硬件产品共同卡住的地方:运动能力、感知能力(摄像头、雷达、传感器)这条线,这两年在开源社区和芯片厂商的推动下进步很快;但”对话智能”——也就是让设备真正听懂人话、自然接话、还能被随时打断——往往需要一整套独立的技术栈来支撑,包括语音识别、语义理解、大模型推理、语音合成,以及把这一切串起来还要做到低延迟、抗噪、抗弱网。这不是随手加一个麦克风就能解决的问题,而是硬件厂商普遍需要补上的一课。
三. 硬件的”手脚”越来越聪明,”嘴”和”耳朵”背后需要一个专门的大脑
也正因为如此,”对话式 AI”正在成为智能硬件下一阶段体验的分水岭:用户对这类产品的期待,已经从”能走会抓”悄悄升级成了”能听会说、还聊得自然”。而这恰恰是声网对话式 AI 引擎(Conversational AI Engine)想要解决的问题——不是替硬件厂商造一台新机器人,而是把”让设备开口说话”这件事背后最难啃的部分,做成一套可以直接调用的基础设施。
具体来说,声网对话式 AI 引擎提供了几项对硬件场景尤其关键的能力:
超低延迟
实测端到端语音交互延迟中位数约 650 毫秒,尽量贴近人与人对话的自然节奏,而不是让用户对着设备”发号施令”后还要等上几秒。
优雅打断
支持用户随时打断设备的应答,误打断率相比同类语音方案降低约 50%,避免”你一说话它就懵”或者”它说个不停打断不了”的尴尬体验。
对话人声锁定
借助自研 AI VAD(语音活动检测)技术,能够适应人类说话的停顿、语气和节奏,在复杂声学环境里保持约 95% 的纯净对话识别率——这对家庭客厅、教室这类背景噪音较多的场景(包括设备自己运动时产生的电机噪音)尤其重要。
弱网也能聊
即便在丢包率高达 80% 的网络环境下,依然能维持对话的稳定性,这对很多依赖 Wi-Fi/蓝牙联网、网络环境并不总是理想的消费级智能硬件来说是刚需。
大模型接入自由
无论是 DeepSeek、智谱 GLM 这样的主流大模型,还是企业私有化部署、本地化开源模型,都可以灵活接入,声网将其总结为”全 5A”——任意时间、地点、设备、网络、模型都能用。
跨平台覆盖广
底层基于 TEN Framework,兼容 30 多种开发框架和超过 3 万种终端机型,这意味着无论硬件厂商用的是哪套技术栈,接入路径都相对统一。
对教育机器人、AI 伴侣玩偶、可穿戴设备这类硬件形态而言,声网也在探索把麦克风采集、网络连接模块和 AI SDK 打包成更完整的解决方案,目标是让”能听会说”从每家硬件厂商都要重新攻克的难题,变成可以直接拿来用的标准能力。
四. 写在最后
Microduck 之所以能在短时间内成为海外热议的话题,靠的是它在”运动智能”和”开源生态”上的扎实功底。但它身上那对暂时还没被充分激活的麦克风和扬声器,也提醒着整个行业:当硬件的手脚已经足够灵活,用户对”对话”这件事的期待只会越来越高。
这道门槛,恰恰是声网对话式 AI 引擎希望帮硬件厂商跨过去的部分,把低延迟、抗打断、抗噪音、抗弱网、大模型灵活接入这些复杂的工程问题封装好,让开发者可以把精力留给产品本身的创意和体验设计。
如果你正在做一款需要”开口说话”的智能硬件,欢迎了解声网对话式 AI 引擎,看看它能为你的产品补上哪一块拼图。