什么是AI推理优化?它和AI训练有什么本质区别?
AI推理优化与AI训练有三个本质区别:计算方向上推理只有前向传播、计算量约为训练的三分之一;优化目标上训练看准确率,推理看延迟、吞吐量与成本;分工上训练属算法工程师,推理优化属系统工程师。推理优化具体包括量化(7B模型FP32需28GB显存,量化后体积缩小4-8倍)、CUDA Kernel优化与调度优化(如vLLM的PagedAttention解决显存碎片化)。
AI推理优化与AI训练有三个本质区别:计算方向上推理只有前向传播、计算量约为训练的三分之一;优化目标上训练看准确率,推理看延迟、吞吐量与成本;分工上训练属算法工程师,推理优化属系统工程师。推理优化具体包括量化(7B模型FP32需28GB显存,量化后体积缩小4-8倍)、CUDA Kernel优化与调度优化(如vLLM的PagedAttention解决显存碎片化)。
作者拆解正点原子DL16 Plus逻辑分析仪,其核心为紫光PGL22G FPGA加沁恒CH32V305 RISC-V MCU加南亚4Gbit DDR3(可用3.5Gbit)方案,Buffer模式下8通道1GHz、16通道500MHz,原始数据率约8Gbit/s先写入DDR3再经USB 2.0上传,3.5Gbit缓存不压缩约可录0.44秒。
推荐理由:拆解给出了从FPGA到阈值前端的完整链路,可对照理解1GHz采样如何靠PLL多相时钟与DDR3缓存实现。
教程基于瑞萨 RZ/G2L MPU,通过 apt 安装预编译的 LVGL 与 Mali GPU 用户态驱动,在 Ubuntu Server 上用 DRM 直接驱动 GPU 跑起 3D 卡车 demo,1024x768 下约 30 FPS。
推荐理由:教程给出了完整命令与关键开关,读者可照做在 MPU 上省去交叉编译直接跑起 LVGL 3D demo。
文章解析中国科学院计算技术研究所牵头的开源 RISC-V 处理器 XiangShan(香山),其昆明湖 V2 版 SPEC CPU 2006 实测达 16.5 分/GHz,首代雁栖湖约 7 分/GHz、南湖约 10 分/GHz。
推荐理由:文章拆解乱序流水线与差分测试机制,并给出可直接执行的仿真构建命令,嵌入式工程师可照做。
作者建议从一个能在现有开发板上运行的小模型入手,从训练一直做到板端输出,哪里不会补哪里。第一个实验推荐正弦波拟合,输入输出易生成易检查,可集中学习训练、转换和调用流程,TFLM 的 Hello World 示例即提供这条路线。
作者在STM32H743ZIT6上跑通手写数字识别全流程:触摸屏笔迹经Bresenham连线与3×3笔刷栅格化成28×28灰度图,交给14,410参数的CNN本地推理,LCD显示识别结果、置信度和耗时。
推荐理由:原文给出模型结构、量化前后准确率与板端逐字节比对方法,可迁移为MCU部署的验证流程参考。
作者用一个正弦波回归模型完整演示了从 PC 训练到 MCU 推理的链路,部署在 STM32F103RCT6 上,模型文件 2488 B,TFLM Tensor Arena 配置为 2048 B。
推荐理由:原文给出模型结构、量化参数和固件资源占用,可作为 MCU 上跑通回归模型的完整参考流程。
盘点 20 个嵌入式领域值得收藏的网站,覆盖 6 大类:技术博客(Memfault 的 Interrupt、MCU on Eclipse、DeepBlueMbedded。
Unboxed STEM Club 三位 10-13 岁少年用 Raspberry Pi 3 Model B+ 与 Raspberry Pi Camera Module 3 打造低成本 DIY 水下相机 Sensea,整机约 £130,用于探测本地池塘与河流的水质和生物。
作者在 ESP32 小型应用平台系列第 7 篇中,用腾讯云 COS 承载 index.json 静态目录和签名 .app 安装包,打通生成目录、上传 COS、ESP32 读取 index.json、判断版本、下载、校验、安装的完整链路。
推荐理由:原文拆解了静态目录加签名安装包的两层校验设计,做设备端应用分发的开发者可直接借鉴其发布顺序与下载落盘方案。
单片机上运行数字识别AI模型,实现端侧AI与嵌入式AI的数字识别演示。原文仅以话题标签形式给出这一演示主题,未披露所用芯片型号、模型结构、算力与功耗等具体参数。
文章介绍 ESP32 小型应用平台第 6 篇:多个 WASM 小应用共用一块 Flash 时,平台只向应用开放 platform_kv_get 和 platform_kv_set 两个 API,由平台决定数据写入位置。
推荐理由:文章拆解了从命名空间映射到碰撞拒绝的完整隔离链路,做类似多应用共存设计的工程师可直接借鉴其检查顺序与限流参数。
Github 项目 Pocket-Lab-Power-Supply 把实验室电源做进 4S 21700 电池包,输出 1V~20V 步进 100mV、限流 0.1A~5A 步进 50mA,外壳约 10cm。
推荐理由:逐块拆解了原理图与关键芯片选型,想复刻或借鉴电源设计的工程师可直接参考。
在 Terasic atum3 开发板上用 Nios-V 跑 FreeRTOS 实现 WebServer,通过以太网 TCP 发送 22Mbits 数据时,传输耗时在 3.5s 与 10.7s 间交替;每次开 socket 只发一次再关闭则稳定为 3.5s。
立创开源硬件平台用户Pinkman1开源了"Mechanical flower"机械郁金香项目,触碰叶子即可触发花瓣开合、花芯亮起随机灯光。项目使用XIAO、舵机、7颗WS2812、TP4056模块、3.7V电池,配合3D打印花体与2块PCB板(控制及电源管理板、异形灯板)制作,源码已开源。
文章以DDR4 32-bit接口为例,说明单次传输按DQ位宽是4Byte,但一次READ/WRITE命令后DQ会连续传输多组数据,BL8下合计32Byte。
HALO-90是一款直径24mm的开源电子耳环,正面排布90颗0402红色LED,采用Charlieplexing方式用10个IO口独立控制全部灯珠,靠高速扫描利用视觉暂留成像。
嵌入式大杂烩公众号在中秋大促期间推出「瑞芯微 Linux 驱动终极套装」课程,面向从单片机转向 Linux 底层驱动开发的工程师,共 30 个模块、266 节课,围绕 Linux 驱动子系统展开。课程配套完整实战项目、瑞芯微 Linux 驱动知识库与一对一辅导,并发放课程优惠券,名额与优惠券数量有限、先到先得,需扫码关注公众号回复暗号了解详情。
文章解读开源项目 audio-reactive-led-strip(Scott Lawson 开发,MIT 协议,GitHub 超 3000 星)的架构:上位机用 PyAudio 采集 44.1kHz 音频并经 NumPy/SciPy 做 FFT 与 24 阶 Mel 滤波。
推荐理由:原文拆解了上位机与下位机分工架构及 Mel 滤波、I2S DMA 关键细节,做灯效开发的工程师可直接对照选型。
作者介绍其 ESP32 WASM 小应用平台如何限制应用权限:Manifest 声明 display、touch、storage 三种权限并随 .app 一同签名,真正的检查分布在安装校验、WASM 加载、事件分发和每次系统 API 调用中。
推荐理由:原文逐层拆解了 Manifest 声明、API 调用检查和资源配额三层机制,做类似沙箱设计的工程师可直接借鉴其检查落点。
文章用厨房做菜的类比厘清了 Async、Concurrency、Parallelism 三个概念:Async 解决等待时线程不闲着,Concurrency 解决海量任务的组织调度,Parallelism 解决多核算力的物理执行。
文章以瑞萨RA6B1专用发行包从2.1.0升级到2.2.0为样本,讲解FSP灵活配置软件包升级的完整检查方法。
推荐理由:文章以一次FSP升级为样本,给出升级前基线、生成后六类差异审查等可迁移的检查步骤。
瑞萨RA0E1单片机通过硬件I²C驱动0.96英寸OLED模块(驱动IC为SSD1306,128*64像素点阵,工作电压3.3~5V),在e2 studio中新建Stacks - IIC master并定义地址0x3C,移植oled.c等文件后实现图片与文字交替显示,每隔500ms刷新页面一次。
CodeGraph 是开源工具,用 Tree-Sitter 把代码库解析成本地 SQLite 知识图谱,通过 MCP 服务器供 AI 编程工具查询调用链与依赖。
推荐理由:文章给出安装、配置到影响分析的完整命令与嵌入式场景用法,可直接照做落地。
FluidNC 是由 Grbl_ESP32 核心作者团队重构的开源运动控制固件,GPL-3.0 协议,GitHub 超过 2800 颗星,最新稳定版 v4.1.0,以 ESP32 与 ESP32-S3 为核心平台。
推荐理由:文章梳理了 FluidNC 用 YAML 声明硬件和 I2S 扩展脉冲的做法,做多轴设备选型时可对照其适用边界。
Cactus Compute 展示了 14MB 的 function-calling 模型 Needle 2,可在 Raspberry Pi 5 上仅用 CPU 把自然语言转成本地动作,输入 Turn the LED on 后 78 毫秒点亮 LED。
推荐理由:原文给出完整 Python 代码与各次调用的延迟、内存数据,想在树莓派上做本地 function calling 的人可以直接照着复现。
文章讲解STM32项目部署AI模型时内部Flash放不下模型数组的排查与选型方法:先按只读权重、激活缓冲区、输入输出缓冲区、代码与栈四类数据分别估算Flash和RAM需求,再对照内部Flash、外部QSPI/OSPI NOR Flash、外部SDRAM/PSRAM、SD卡四种存放位置的适用场景与检查项。
推荐理由:文章给出容量与RAM的基本式和四类存放位置的对照表,做MCU模型部署选型时可直接照此排查。
一位C++老程序员分享了从排斥AI编程到形成"人类主导设计 + AI高效执行 + 工具验证"工作流的转变过程。AI适合做模板化脚手架生成、单元测试编写、CMake配置等任务,但在并发正确性、生命周期与所有权保证、Lock-Free算法设计等场景需谨慎验证。借助Sanitizer日志配合AI定位,内存越界和悬空引用问题的排查从半天缩短到十几分钟。
米尔电子发布 RK3576 MIPI Camera 的 ISP 调试教程,覆盖硬件准备、环境搭建、BLC/LSC/AWB/CCM 标定、AE/3DNR/Sharpen/Gamma/3D LUT 主观调试、IQ 文件烧录与常见问题排查。
推荐理由:文章把 BLC 到 CCM 的标定顺序、验收阈值和常见故障排查串成完整流程,照着做可少走弯路。
文章介绍用 Webots(Cyberbotics 维护、Apache 2.0、最新稳定版 R2025a)在硬件回板前验证底盘运动学与避障逻辑:控制器作为独立子进程运行,通过共享内存或 TCP/IP 与仿真内核通信,wb_robot_step(TIME_STEP) 以 32ms 同步步长推进刚体积分,结果确定可复现,关掉渲染可加速到 10 倍、50 倍跑回归测试。
作者整理了一套独立开发工具链,除域名外全部用免费额度解决,年成本压到 100 元以内。AI 编程用华为云 CodeArts Agent、阿里通义灵码个人版、GitHub Copilot 免费版(每月 2000 次补全);大模型靠阿里云百炼新用户 7000 万 Token、智谱 2000 万、火山引擎豆包每模型 50 万。
作者为 ESP32 WASM 小应用平台设计了一层受控的系统 API,让应用通过 platform 导入模块请求绘图、时间和键值存储能力,而不直接接触底层硬件。
推荐理由:原文逐条列出绘图调用的权限、配额与边界检查项,做类似受限运行时接口设计时可直接参考。
技术极客 Gadget Industry 把一台屏幕摔坏的三星 Galaxy S21 5G 拆解后,将主板、Type-C 子板和电源键排线装进无线鼠标壳,接上显示器即可进入三星 DeX 桌面,可运行浏览器、多窗口和《我的世界》,同时仍能当鼠标使用。
文章解释了训练好的AI模型如何经STM32Cube.AI转换后在STM32上运行推理。神经网络本质是乘加、比较、移位等确定运算的组合,训练得到的参数与计算流程在推理阶段均已固定,因此可脱离Python执行。STM32Cube.AI解析模型计算图,将权重转为Flash中的数据(如INT8量化的int8_t数组),将各层转为可调用的算子函数,配合CMSIS-NN等优化在MCU上完成推理。
文章通过 evpp、ROS2 rclcpp、POCO 三个真实 issue,说明 shared_ptr 在循环引用和异常安全场景下仍会内存泄漏:evpp 的 InvokeTimer 自持 shared_ptr 导致引用计数无法归零。
机器人常用传感器按本体感知、环境感知、力觉触觉分为内部与外部两类,涵盖编码器、IMU、电流传感器、超声与红外、激光雷达、视觉、六维力传感器、触觉、GNSS 等。单点定位米级、RTK 厘米级,超声波约 40kHz,GNSS 至少需 4 颗星解算钟差。现代机器人靠卡尔曼滤波做多传感器融合,如无人机用 IMU+GNSS 悬停、仓储机器人用激光雷达+轮式里程计导航。
文章讲解开源库 Arduino-FOC(SimpleFOC,GitHub 3000+ Star,MIT 协议)如何在 STM32、ESP32、RP2040 等通用 MCU 上实现无刷电机矢量闭环控制,替代发热丢步的开环步进方案。
推荐理由:文章把 FOC 坐标变换、环路分层和四个现场避坑点讲透,还给出四类方案的单轴成本与门槛对照表,便于选型。
文章讲解高速PCB过孔的等效RLC模型、寄生电容与寄生电感的估算公式及其对信号的影响,例如0.3mm过孔寄生电容约0.3–0.8pF,0.5pF过孔电容可使10Gbps信号眼图张开度降低约10%–15%。
文章梳理了嵌入式开发常用的 MIT、Apache 2.0、GPL/LGPL、BSD、MPL 2.0 五类开源协议的条款与适用场景。
文章讲解嵌入式代码如何做单元测试与硬件在环验证:把分压换算、阈值判断等纯逻辑从ADC读取和继电器动作中抽离成纯函数,使其可在PC上直接测试。文中给出用Unity和Ceedling搭建最小测试框架的示例代码与gcc编译命令,介绍用桩函数在链接时替换硬件依赖(CMock可自动生成),并对比PC端与目标板测试的分工,提醒int宽度差异可能导致交叉编译后行为不一致。
推荐理由:文章给出把决策逻辑从硬件IO剥离的具体改法和Unity最小用例,可直接照搬到现有项目。