FCC 对外国机器人限制或加速机器人转向本地 AI 架构
FCC 于 7 月将外国产先进机器人设备列入构成国家安全或安全风险的清单,新设备无法获得进口、在美销售所需的 FCC 认证,涵盖人形与四足等可采集环境信息的移动机器人。
推荐理由:文章梳理了FCC限制如何从采购传导到机器人架构选择,对评估本地推理与供应链策略有参考价值。
FCC 于 7 月将外国产先进机器人设备列入构成国家安全或安全风险的清单,新设备无法获得进口、在美销售所需的 FCC 认证,涵盖人形与四足等可采集环境信息的移动机器人。
推荐理由:文章梳理了FCC限制如何从采购传导到机器人架构选择,对评估本地推理与供应链策略有参考价值。
树莓派官方博客介绍基于 DEEPX DX-M1M NPU 的 Sixfab AI HAT+,为 Raspberry Pi 5 提供 25 TOPS AI 算力,典型持续 NPU 功耗约 3 W,并保留 CPU 处理相机、应用逻辑与连接。
推荐理由:原文给出 DX-M1M 与 DX-M1 在 CNN 与 Qwen3-1.7B 上的实测数据和 3 W 功耗口径,可为边缘 AI 加速选型提供对照。
作者用199元开放协议蓝牙AI录音卡、阿里达摩院FunASR和私有化部署的DeepSeek,搭出一套本地存储、离线识别的语音转写与会议纪要系统,全程数据不上云。
推荐理由:文章给出录音卡蓝牙协议分层解析和 FunASR 本地部署命令,可迁移到同类离线语音转写系统的搭建。
DEBIX M8391-01 工业 SBC 搭载 MediaTek MT8391(Genio 720)SoC,配 NPU850 AI 加速器,算力达 9 TOPS,可本地运行视觉、transformer 与 LLM 推理。
魔芯科技的4D世界模型MoWorld随华为Mate 90系列发布进入消费端,鸿蒙独占应用「摸小宠」可将几张手机拍摄的宠物照片生成可任意视角浏览的4D数字猫。技术上采用端云协同,云端昇腾NPU生成3D高斯模型,约6亿参数的MoWorld-2.0-Flash经量化裁剪后跑在麒麟芯片上完成端侧渲染,推理成本约为进口GPU方案的30%。
文章认为AI会取代把需求翻译成能跑代码的工作方式,但工程经验反而更值钱。文中汇总多组实验:大模型在126道嵌入式小练习上最强的DeepSeek-R1只做对55.6%,无硬件反馈时Claude Opus 4.7、Gemini 3.1 Pro等模型十轮内一次都没部署成功;16名资深开发者用AI后实测反而慢了19%,新手测验分数低了17%。
推荐理由:原文汇总了多组大模型写嵌入式代码的实测与对照实验,可用于判断AI在硬件相关任务上的真实边界。
研究提出激活对齐(activation alignment)方法,通过在合成无标签数据上训练一个轻量线性变换,将使用部分上下文的"学生"模型的中间激活映射向使用全部数据的"教师"模型,训练对齐器无需 GPU,在普通硬件上数秒至数分钟即可收敛。
LoGRA 通过低秩梯度草图保留有效学习信号,将 LLM 强化学习后训练的平均训练内存最多降低 45.7%,且不损失性能。该方法配合 predicted-KL 步长控制,在单个八 GPU 节点上稳定训练 27B 参数模型超过 1,100 步,而 dense Adam 会显存耗尽,使原本内存不可行的 RL 训练变得可行。代码已在相关库中开源。
华为Mate 90系列全系搭载旗舰τ芯片,采用逻辑折叠芯粒堆叠架构,实现125TB/秒跨Die带宽、关键路径时延下降30%,华为Mate 90 Pro Max整机性能较上代提升31%。华为Mate 90 Pro Max配备18EV超高动态主摄、2亿像素大底长焦与第三代红枫原色影像,第二代灵珑屏峰值亮度达12000nit。鸿蒙终端设备数已越过9000万,最新鸿蒙7强化系统级AI与星盾安全架构。
开源 ESP-SDR 固件绕过 ESP32 的 Wi-Fi/蓝牙调制解调器,直接从内部 ADC 信号链采集原始 I/Q 基带采样,无需外接 SDR 硬件即可把 ESP32 变成软件定义无线电接收机。
推荐理由:固件通过逆向 librftest 的 adctrig 调试寄存器让 ESP32 直采 I/Q,为低成本 SDR 方案提供了可复用的实现路径。
LLM-as-Jev 框架在 Qwen3.5-4B 和 Qwen3-0.6B 上验证了通用 LLM 无需训练即可直接输出校准的分类决策,4B 模型免训练表现与同底座社区 Jev 式模型持平,且优于 letter-logit 读出方式,支持任意选项数量并原生处理图像多模态决策。
贺老师基于 STM32H743(Cortex-M7 内核,带 DSP 指令)完成 TinyML 开发板,用 TensorFlow Lite Micro 部署模型,规划麦克风、IMU、模拟量、摄像头四类传感器入口。
一块用于学习 TinyML 的开发板至少应包含计算、数据采集、结果展示、通信和控制四部分。STM32H743 端侧 AI 开发板定位 TinyML 嵌入式 AI 模型部署实战学习板,覆盖从模型部署到硬件落地的完整链路。
开源智能手表 Watchy 软硬件 100% 开源,采用乐鑫 ESP32-S3FN8 主控和 200x200 像素电子墨水屏,续航可达 30 天。它内置 DS3231 高精度 RTC 和 BMA423 三轴加速计,支持步数计数、抬手亮屏、实时天气、番茄闹钟、指南针与蓝牙 Wi-Fi 连接。
2026年上半年,人形、四足机器人进入焊接展示和试点场景,焊接单元旁开始出现数百TOPS算力的边缘计算平台,竞争焦点转向负责焊缝识别、轨迹规划与工艺决策的焊接大脑。
推荐理由:原文梳理了多家焊接大脑企业的技术路线差异,可帮助理解具身智能向焊接等工艺场景迁移的共性与边界。
AAEON 推出 UP Xtreme PTL Edge Air 版本,采用 Frore Systems AirJet 固态主动散热,机身较原版薄 35%、轻 43%,运行噪音低于 21 dBA。
Avaota F2 是首款基于全志 V861 双核 64-bit RISC-V SoC 的开发板,内置 128MB DDR3、支持 4K 摄像头、H.265 编解码和 1 TOPS NPU,面向 AI 相机并支持 PTZ 电机控制与扬声器、双麦克风接口。
推荐理由:原文给出完整规格、开源硬件资料清单与售价,可作为 AI 相机方案选型时的横向比较参考。
NVIDIA 推出开源 C++ 样例集 Do Inference Now (DIN) Deploy,将 ONNX Runtime 与 NVIDIA TensorRT RTX 执行提供程序结合,帮助开发者从模型 checkpoint 走到本地原生应用。该样例集面向本地应用集成 AI 模型,提供可移植模型格式、可靠运行时与跨目标系统的加速支持。
Glimpse 是一款软硬件全开源的摩托车极简导航与仪表设备,基于乐鑫 ESP32-S3 主控和 1.75 英寸 466×466 圆形 AMOLED 屏,通过蓝牙连接 iPhone 调用高德导航,实现定位、地点搜索、路线规划与转向提示同步显示。
推荐理由:原文给出了硬件选型、导航界面元素定义和编译部署步骤,想复刻圆屏导航器的开发者可据此评估工作量。
曙光8000 国产十万卡 AI 超集群通过"超级隧道"打通网卡、CPU 核心与硬盘之间的直通数据路径,以微控、零中断、零竞争、零拷贝减少计算卡等待数据的开销。配套 GPU 直通存储技术 XDS、BurstBuffer 缓冲层与内存加速层分层承接传输、突发读写与高速访问需求,并延伸至 ParaStor 分布式全闪存储与 FlashNexus 集中式全闪存储产品。
SSR(Selection-based Structured Reasoning)框架将多模态搜索智能体的推理从开放式生成改为从预设可复用的自然语言候选中选择,无需辅助任务头。在七个多模态搜索基准上用 2B 和 4B 模型评测,SSR 在多种强化学习目标与监督微调下,每轮推理时延降低超过 90%,每题总模型推理时延降低 28-54%,平均成功率与同规模领先搜索智能体相当。
NVIDIA NeMo Relay 可追踪 Agent Harness 的执行路径,暴露任务完成背后的低效行为。失败搜索触发重复搜索、截断的文件读取导致命令重复抓取同一内容等冗余步骤会增加时延并消耗 token,即使最终答案正确也会被掩盖。这些低效还带来更多失败机会,追踪能力为改进 Agent 行为提供依据。
DeepSeek 宣布算子开发工具 TileLang 原生支持华为昇腾 950,同时推出 DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect 五个计算与通信库的昇腾版本。
推荐理由:原文给出 TileLang 昇腾后端的四层流水线设计与各平台支持状态,可据此评估跨硬件算子开发的迁移成本。
华为在AIDC产业发展大会上发布3D数据中心,采用供冷层、IT算力层、供电层、备电层的垂直四层立体堆叠架构,面向大规模智算集群。小枣君解读称,该设计将电力模块至机柜的供电距离从17米缩短至5米,IT供电容量从76MW提升至168MW,机电预制化率超90%,机电交付周期从6个月压缩至3个月。
推荐理由:原文拆解了四层垂直堆叠架构如何压缩供电距离与交付周期,可作为理解智算基础设施演进的参考。
30 亿参数的 π0 在 RTX 4090 上 KVcache 预填充就要 46ms,远超 20ms 控制周期,7B 的 OpenVLA 8bit 量化后在 A5000 上只剩 1.2Hz,VLA 推理延迟成为灵巧手实时控制的瓶颈。
立创开源硬件平台转载介绍 songge8 的琛光E1 Nano 超小 ESP32 开源无人机,主控为 ESP32S3-SuperMini,姿态传感器为 MPU-6500,通过 PWM 控制四路 MOSFET 调节电机转速实现平衡飞行,支持自带 WEB 遥控器、APP 和 ELRS/CRSF/SBUS 实体遥控。
推荐理由:给出了硬件清单、调试命令和校准合格范围,想复刻迷你飞控的读者可照着步骤操作。
TICKEY在Kickstarter获7909名支持者、筹资671万港币(85万美金),远超1万港币初始目标。
推荐理由:原文拆解了ESP32-S3加彩色电子纸的软硬件分工与功耗取舍,做类似低功耗显示项目的工程师可参考其架构选择。
文章指出,以在STM32、ESP32、RISC-V MCU上运行AI模型为目标的嵌入式工程师,完全没必要先花几个月系统学Python。作者认为真正需要掌握的只是基础语法、NumPy数组与shape/reshape等维度概念,以及Pandas读CSV、Matplotlib看波形、TensorFlow/Keras的简单模型定义与训练代码,面向对象高级用法、异步、Web开发等可暂缓。
AI推理优化与AI训练有三个本质区别:计算方向上推理只有前向传播、计算量约为训练的三分之一;优化目标上训练看准确率,推理看延迟、吞吐量与成本;分工上训练属算法工程师,推理优化属系统工程师。推理优化具体包括量化(7B模型FP32需28GB显存,量化后体积缩小4-8倍)、CUDA Kernel优化与调度优化(如vLLM的PagedAttention解决显存碎片化)。
作者建议从一个能在现有开发板上运行的小模型入手,从训练一直做到板端输出,哪里不会补哪里。第一个实验推荐正弦波拟合,输入输出易生成易检查,可集中学习训练、转换和调用流程,TFLM 的 Hello World 示例即提供这条路线。
作者在STM32H743ZIT6上跑通手写数字识别全流程:触摸屏笔迹经Bresenham连线与3×3笔刷栅格化成28×28灰度图,交给14,410参数的CNN本地推理,LCD显示识别结果、置信度和耗时。
推荐理由:原文给出模型结构、量化前后准确率与板端逐字节比对方法,可迁移为MCU部署的验证流程参考。
作者用一个正弦波回归模型完整演示了从 PC 训练到 MCU 推理的链路,部署在 STM32F103RCT6 上,模型文件 2488 B,TFLM Tensor Arena 配置为 2048 B。
推荐理由:原文给出模型结构、量化参数和固件资源占用,可作为 MCU 上跑通回归模型的完整参考流程。
作者在 ESP32 小型应用平台系列第 7 篇中,用腾讯云 COS 承载 index.json 静态目录和签名 .app 安装包,打通生成目录、上传 COS、ESP32 读取 index.json、判断版本、下载、校验、安装的完整链路。
推荐理由:原文拆解了静态目录加签名安装包的两层校验设计,做设备端应用分发的开发者可直接借鉴其发布顺序与下载落盘方案。
单片机上运行数字识别AI模型,实现端侧AI与嵌入式AI的数字识别演示。原文仅以话题标签形式给出这一演示主题,未披露所用芯片型号、模型结构、算力与功耗等具体参数。
瑞萨2026边缘AI技术研讨会(上海&深圳)正式开启报名,上海站定于2026年10月24日13:00–17:30,深圳站定于2026年11月7日13:00–17:30。研讨会将展示RA8、RZ/V系列AI处理器全新应用场景,并设置AI实操实验项目,帮助工程师现场完成第一个hello_world工程和AI模型部署。报名并到场的观众可参与抽奖,前30位现场签到的观众可获得RA MCU开发板。
文章介绍 ESP32 小型应用平台第 6 篇:多个 WASM 小应用共用一块 Flash 时,平台只向应用开放 platform_kv_get 和 platform_kv_set 两个 API,由平台决定数据写入位置。
推荐理由:文章拆解了从命名空间映射到碰撞拒绝的完整隔离链路,做类似多应用共存设计的工程师可直接借鉴其检查顺序与限流参数。
Github 项目 Pocket-Lab-Power-Supply 把实验室电源做进 4S 21700 电池包,输出 1V~20V 步进 100mV、限流 0.1A~5A 步进 50mA,外壳约 10cm。
推荐理由:逐块拆解了原理图与关键芯片选型,想复刻或借鉴电源设计的工程师可直接参考。
文章解读开源项目 audio-reactive-led-strip(Scott Lawson 开发,MIT 协议,GitHub 超 3000 星)的架构:上位机用 PyAudio 采集 44.1kHz 音频并经 NumPy/SciPy 做 FFT 与 24 阶 Mel 滤波。
推荐理由:原文拆解了上位机与下位机分工架构及 Mel 滤波、I2S DMA 关键细节,做灯效开发的工程师可直接对照选型。
作者介绍其 ESP32 WASM 小应用平台如何限制应用权限:Manifest 声明 display、touch、storage 三种权限并随 .app 一同签名,真正的检查分布在安装校验、WASM 加载、事件分发和每次系统 API 调用中。
推荐理由:原文逐层拆解了 Manifest 声明、API 调用检查和资源配额三层机制,做类似沙箱设计的工程师可直接借鉴其检查落点。
9月22日,龙芯中科发布支持自研通用GPU的龙芯加速计算平台(Loongson Accelerated Computing Platform)首个软件版本,基于龙芯2K3000及9A1000内集成的自研LG200系列通用GPU核心打造,覆盖推理引擎、高性能算子库、专用编译器、运行时环境、调试工具及性能分析套件,支持OpenCL 3.0与CUDA两类编程模型。
推荐理由:原文列出了平台的核心组件、编程模型支持和适配框架,选型国产算力的工程师可据此评估迁移成本。