前言
这,是一个AI口袋机****!

*0***1
它有这7大功能
”
1
多模态 AI 对话助手:按键唤醒对话、VAD 自动检测语音、唤醒词模式,能翻译、辅助学习、聊天
2
AI 虚拟宠物系统:能给宠物喂食、看医生、宠物会根据状态改变表情,实时显示宠物健康能量清洁快乐值
3
游戏掌机功能:带摇杆、按键、彩色显示屏,能玩贪吃蛇俄罗斯方块这样的小游戏。
4
主页实时显示:时间、天气、AI 回复文字、系统状态,支持菜单切换、图标显示、动画效果
5
音频功能:支持回声消除 AEC、自动增益 AGC、降噪 ANR、语音活动检测 VAD
6
传感器功能:可以实现摇晃检测、姿态识别、计步、动作交互,顺便配合上述功能实现摇一摇给宠物喂饭的功能
7
IoT 智能家居控制:可以连接涂鸦 AI 云平台,通过它语音控制灯、插座开关,并查询智能家居状态
除此之外,如果你想基于这个方案二次开发,你可以做……
1
AI图像功能:结合多模态模型,可以扩展AI识图、OCR文字识别、图片理解、AI生成内容
2
外设扩展能力:支持连接更多硬件,比如:做RFID读卡器用于门禁模拟、NFC互动、卡片识别;做热敏打印机,可以打印AI生成内容、图片、小票、标签;也可以通过接口扩展温湿度、摄像头、GPS、4G模块
3
开发者实验平台能力:它提供PCB、BOM、软件源码、TuyaOpen SDK、3D结构文件,可以改造成教育学习机,工业监控终端,智能硬件原型
小tips:以上提到的部分方案,包含且不限于云端 AI-Agent智能体开发、RFID模块、热敏打印机……已有软硬件资料可参考,欢迎前往开源网址了解详情!
那么,想实现这些功能,这个AI口袋机的硬件,软件具体是怎么设计的呢?
*0***2
硬件设计方案
”
01
结构图

02
实物图

03
设计图
作者基于嘉立创EDA,设计了3块PCB:
3.1 主板
工艺:4 层板,板厚1.2mm

原理图

PCB图
3.2 Pogo Pin FPC 排线工艺
工艺:2层板,板厚0.15mm,补强PI 0.15mm,注意补强需使用 PI 材料,钢片补强会影响 Pogo 磁铁的磁力

原理图

PCB图
3.3 输入/输出接口扩展板

原理图

PCB图
04
核心硬件能力
-
涂鸦T5模组 (WIFI 6 + BLE 5.4)
-
2.9 英寸单色低功耗 LCD 屏幕
-
4G蜂窝,提升便携性
-
摄像头
-
麦克风/喇叭
-
6轴传感器
-
任天堂同款手柄和电池
-
MicroSD卡 外部存储
-
丰富的摇杆(X-Y 轴)和按键输入
05
扩展接口
-
可扩展Pogo Pin弹簧针(电源+UART)
-
可扩展 10 针排针(I2C/SPI/UART/GPIO)
-
USB Type-C 2.0 接口(充电/烧录/调试)
*0***3
软件设计方案
”
软件部分基于 TuyaOpen 开源框架。
TuyaOpen 是一个面向 AI Agent + IoT 的完整类 RTOS 操作系统。该开源框架可助力开发者高效开发传统 IoT 连接设备,实现快速配网流程和 App 交互能力。此外,AI Agent 能力可深度整合到端侧硬件,实现端云结合,为硬件提供更高的泛化能力,使 AI Agent 与场景结合得更好。
01
软件整体框架
Tuya-T5-Pocket 软件架构基于 TuyaOpen 框架构建,采用分层设计,主要包含硬件 BSP 层、云 IoT 事件层、UI 层和 AI 层四个核心层次。
1
硬件 BSP 层:位于最底层,负责硬件抽象和驱动管理。通过 Tuya Abstract Layer (TAL) 提供统一的硬件接口,包括显示屏、摄像头、麦克风、喇叭、传感器、摇杆按键等外设的驱动。BSP 层屏蔽了底层硬件差异,为上层提供标准化的硬件访问接口。板级初始化通常在应用启动时由 board_register_hardware() 函数完成,负责各硬件外设和驱动的初始化,为上层模块提供基础硬件支撑。
2
云 IoT 事件层:负责与涂鸦云平台的通信和事件处理。通过 MQTT 协议与云端建立连接,处理设备绑定、数据点(DP)上报和接收、OTA 升级、时间同步等云服务事件。当收到云端指令时,通过事件回调机制通知上层应用,同时将设备状态和用户操作同步到云端和 App 端。
3
UI 层:基于 LVGL 图形渲染引擎实现用户界面。负责屏幕显示、菜单导航、动画效果和用户交互反馈。UI 层通过消息机制接收来自其他层的事件通知,实时更新界面状态,如网络连接状态、电池电量、AI 功能状态等。支持多语言显示和主题切换。
4
AI 层:提供多模态 AI 能力,包括音频处理、语音识别、LLM 对话和 AI Agent 功能。集成了端侧 3A 算法(VAD/KWS/AEC/ANR/AGC)用于音频预处理,支持音频、视频、文本多模态交互。AI 层可以接收用户语音输入,通过云端大模型进行理解和生成,并将结果反馈给用户。同时支持 Function-Call 能力,使 AI Agent 可以控制设备功能。
02
核心组件
系统主要包含以下核心组件:
1
tuya_iot:云服务核心,管理设备连接、DP 通信和云事件处理
2
ai_audio:AI 音频处理模块,负责音频采集、播放和云端 AI 交互
3
app_display:显示管理模块,负责 LVGL 初始化和界面消息分发
4
game_pet:AI 宠物应用,展示多模态 AI 交互和状态管理
5
app_pocket:主应用协调器,初始化各模块并处理应用级事件
整个架构设计遵循模块化和解耦原则,各层职责清晰,便于开发者进行二次开发和功能扩展。
03
数据与事件流
系统通过事件驱动机制实现用户、硬件、UI 和云端 AI 之间的数据流转和交互。以下是主要的数据流和事件流路径:
典型交互场景示例:
场景1:语音AI对话
用户按下功能键或KWS → 硬件 BSP 层捕获事件 → 应用层启动 AI 对话模式 → AI 层开始音频采集和预处理 → 音频数据上传云端 AI → 云端 AI 返回文本/音频响应 → 应用层接收响应 → UI 层显示文本/硬件播放音频 → 完成交互
场景2:云端控制APP/设备交互
App 端发送音量控制指令 → 云端通过 MQTT 下发 DP 数据点 → 云 IoT 事件层接收 `TUYA_EVENT_DP_RECEIVE_OBJ` 事件 → 应用层解析 DP 数据,调用 `ai_audio_set_volume()` → 硬件 BSP 层更新音频输出音量 → UI 层更新音量显示
场景3:多模态AI交互
用户摇动设备 → 加速度传感器检测动作 → 应用层捕获传感器数据 → 应用层将传感器数据与当前语音/图像一起打包 → 上传到云端 AI 进行多模态理解 → 云端 AI 返回情境化响应 → UI 层显示响应内容,硬件播放音频反馈
所有数据流和事件流都通过统一的事件驱动机制和消息传递接口实现,确保各层之间解耦,便于维护和扩展。
最后,附上一个用户硬件交互输入定义↓

如果看到这里,你还意犹未尽,想深入研究这个口袋机,可前往开源网址,里面有非常详细的软硬件资料和扩展demo哦~看到就是学到!
*0***4
开源网址
”
开源网址:https://oshwhub.com/tuyaopen/graffiti-t5pocket-pocket-machine

评论区
登录后即可参与讨论
立即登录