RunningTab:为 LLM 智能体的直接工作区交互引入环境侧标签页
RunningTab 提出一种为直接工作区交互(DWI)配备环境侧标签页的框架,由环境记录任务待办项、已读文件摘录及已列出但未打开的文件候选。在三个基准测试、三种 LLM 上的验证中,RunningTab 持续优于普通 DWI 及将记录保存在模型内的基线方法,其标签页通常已包含交付物所需内容。
RunningTab 提出一种为直接工作区交互(DWI)配备环境侧标签页的框架,由环境记录任务待办项、已读文件摘录及已列出但未打开的文件候选。在三个基准测试、三种 LLM 上的验证中,RunningTab 持续优于普通 DWI 及将记录保存在模型内的基线方法,其标签页通常已包含交付物所需内容。
SWE-Game 推出一个由 247 项任务构成的游戏开发基准,覆盖 41 个可执行的 Godot 参考游戏、13 种 2D 与 3D 玩法类别,任务类型涵盖从需求简报生成游戏、按设计文档实现、骨架补全、83 例注入故障修复以及 Godot 到 Unity 移植。
论文提出长上下文混合模型机理系列研究 Part 1.1,聚焦全注意力与 SWA 或 GLA、GDN 等线性注意力变体的混合结构。作者观察到上下文扩展中的跷跷板效应,即线性注意力混合模型更受益于长上下文持续预训练,而 SWA 混合模型在长度外推上表现更好,并将其归因于位置归纳偏置差异;同时指出 SWA 混合模型存在短上下文学习陷阱、短窗口倦怠和长窗口惰性。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
GRACE 提出两阶段框架,在压缩预训练视频自编码器的同时保持与预训练 DiT 的兼容:冻结基础潜变量并学习残差潜变量补回强压缩损失的信息,在冻结 DiT 的特征空间中对齐压缩潜变量,再以轻量微调和非对称去噪适配 DiT。
一位创客用 ESP32-S3 制作了一台小型 AM 发射器,接收网络电台流后通过 GPIO 脉冲链生成射频信号,让老式电子管收音机重新发声。发射器采用 3D 打印外壳与支架固定的大间距线圈天线,输出频率为 200kHz 的欧洲长波波段,足以被老式收音机接收。作者指出该发射功率下可能不合规,但认为功率极低不会被察觉。
Efinix 推出 Sapphire RV64 SoC,这是一款面向 Titanium、Topaz 和 Trion(T20 及以上)FPGA 的可配置 64 位 RISC-V 软核,基于 VexiiRiscv,可配置 1 至 4 个核心,主频最高 400 MHz。
推荐理由:原文列出了主频、缓存、内存支持和外设配置,做 FPGA RISC-V 选型的工程师可据此评估是否替换现有 32 位方案。
法国 AI 公司 Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿、混合专家架构每 token 激活 490 亿参数,权重月底全部开源。
推荐理由:原文汇总了多项第三方评测分数与安全基准数据,便于横向比较其与闭源旗舰的差距。
作者为TinyML课程自研了一款嵌入式AI开发板,原因是现成开发板缺少联网模块(如ESP32),且难以在一块板上运行多个与实际产品相关的AI模型(如电机堵转模型)。设计上刻意拿掉WS2812彩灯、舵机/PWM、功耗测量等非必要功能,以简化维护。目标是让学员用同一块板完成数据采集、在STM32上运行模型并接着做联网实验。
文章对比爱芯元智AX8850与瑞芯微RK3588在端侧AI推理上的实测表现,引用双方官方benchmark数据,AX8850在YOLOv5s、YOLOv8n等模型上FPS达到RK3588单核的7~12倍。
推荐理由:原文用双方官方benchmark的同模型FPS对比,把标称TOPS与实际推理性能的差距讲清楚,可迁移为选型时看实测数据的方法。
AdvSim2Real 在冻结的 Web 世界模型中协同进化任务课程、注入对抗样本与 Web Agent,使 4B agent 在有无攻击时完成率均提升,且能力增益可迁移到真实浏览器。在 150 个 Web 任务上,面对未训练过的前沿模型对抗者,AdvSim2Real 将完成率相对基础 agent 提升 33.6%。
NVIDIA 提出用数字孪生与 AI Agent 验证 AI 工厂的基础设施、软件与策略变更。AI 工厂由 GPU、CPU、交换机、DPU、SuperNIC 以及调度器、编排服务、安全控制和快速变化的软件栈组成,部署与验证其协同工作均具挑战。
DSPi 是面向 Raspberry Pi Pico、Pico 2 及其他 RP2040/RP2350 板卡的音频 DSP 固件,可将其变为带集成 DSP 的 USB 声卡,支持房间校正、有源分频、参数 EQ、时间对齐等功能。
推荐理由:原文列出了 DSPi 在 RP2040 与 RP2350 上的滤波器数量、通道数和数学引擎差异,便于按硬件选型评估。
端侧级联语音 Agent 采用推测工具执行方案,通过 Predictor 模块在 ASR 阶段预测工具调用并提前执行、缓存结果注入 LLM prompt,实测 Android 语音助手的中位首音频时间从 5.79s 降至 4.60s,标准差从 3.49s 降至 2.81s。方案用基于规则的校验机制过滤用户自我纠正导致的错误缓存,LLM 仍可直接发起工具调用,最坏情况延迟不高于基线串行流水线。
TRACE 提出一种面向 MoE 语言模型强化学习训练的 FP4 量化框架,通过 rollout 侧量化结果引导训练侧 FP4 舍入决策,直接缩小训练与 rollout 两条量化执行路径的差异。
NVIDIA DOCA GPUNetIO 将网络与数据搬运统一为 GPU 直接控制的一等操作,减少 CPU 在每个网络事务中的介入。CPU 位于关键路径会增加时延并限制分布式应用的实时响应效率,GPUNetIO 旨在消除这一瓶颈。该能力覆盖 NVIDIA 软件栈,面向需要 GPU 发起网络的分布式应用。
NVIDIA 提出 Green Contexts,让单进程内多个独立组件(如时延敏感算子与吞吐导向后台 kernel、数据预处理与模型推理)可控制地共享 GPU 资源。此前这类多组件共用单 GPU 的场景难以划分资源,Green Contexts 用于解决这一控制难题。
Overview AI 推出 OV Spark 与 OV Spark Pro 两款 AI 检测相机,内置 agentic AI 层 Sparky,可用自然语言回答检测相关问题。
推荐理由:原文给出了硬件规格、工具清单和 MEC 落地案例,便于评估该相机在产线的实际可用性。
ESP Mini App Platform 0.4.9 Beta 开放发布,面向 ESP-Mosaico 开发板(主控 ESP32-S31),系统与应用分离,支持安装、更新、卸载独立应用。
Meta 开源了 Muse Gadgets 硬件开发套件,包含乐鑫ESP32固件和 Linux SDK,开发者可用几十元的 ESP32 开发板或树莓派为个人桌面 AI Agent Muse 制作物理外设,实现智能家居控制、日程提醒等功能。
推荐理由:原文给出了硬件BOM成本、固件与Linux SDK分工和刷写绑定流程,想自制Muse外设的开发者可据此评估上手成本。
新型决策模型 Jev 数周前发布,专注分类与决策任务,无法写出任何句子,但可极快地完成分类与归类。它接受文本输入,仅输出浮点数,作为用户指定的 yes/no 问题、选项列表和评分请求的答案。Simon Willison 总结了 Jev 的做法,Kev 与 Nimble 等同类模型也已出现,Nimble 刚被 Ollama 支持,体积小到可相对轻松地本地运行。
Luca Soltoggio 让两块 ESP32 用单颗 LED 同时作发射与接收器件,通过可见光完成通信。这套名为 SecurePair 的 Arduino 库用于交换密钥并进行加密通信,也可配合 ESPNow 或 LoRa 使用,典型场景是用光完成配对、用无线传输加密数据。它利用了 LED 同时具备一定光电二极管特性的原理,且参与通信的设备不限于两块 ESP32。
香橙派发布 O1 开发板,首次采用算能 BM1688,TPU 算力 16TOPS@INT8、32TOPS@INT4,配 8 个 Cortex-A53 核心与 RISC-V C906 协处理器。该板带 SATA3.0、双千兆网口、CAN 与 RS485 等接口,内存可选 8GB 或 16GB,8GB 版 1699 元、16GB 版 2799 元,定位工厂监控等边缘 AI 场景。
推荐理由:原文给出算力、接口、价格与同类开发板对比,选型时可据此评估边缘AI场景的取舍。
WorldSonus 提出面向世界模型的交互式视频到音频框架,用于实时空间声音合成。其采用流式因果自回归扩散架构,以 0.41 的低实时因子(RTF)生成音频块,并通过音频描述流水线与按块索引的提示调度实现生成中动态控制声音事件,同时用立体声与 ambisonic 数据做空间对齐监督。
报告提出 nanoMuse,一个 GPL-3.0 开源的个人智能体,运行在用户拥有的每台设备上,可操作手机和电脑屏幕,通过任何人可运行的中继共享同一段对话,所有动作经 Sentinel 审核,记忆以用户可读的文件形式保存,模型由用户自选。
Recurrent Looped Transformer(RLT)将层分为并行因果编码器与循环解码器,每个 token 上解码器融合编码器输出与上一 token 的最终解码状态,使计算路径随序列长度增长而单 token 成本固定。
Hugging Face 收录论文提出 DLoop,一种循环形式的投机解码方法,在验证前自适应执行多轮草稿阶段,草稿模型保持高置信时持续起草并一次性验证累积的草稿 token。
研究团队提出 ProactiveCoach 套件,包含训练集 ProactiveCoach-Instruct、评测集 ProactiveCoachBench 与自适应引导系统,在阶段、步骤、动作三个层级提供结构化引导数据。
FCC 于 7 月将外国产先进机器人设备列入构成国家安全或安全风险的清单,新设备无法获得进口、在美销售所需的 FCC 认证,涵盖人形与四足等可采集环境信息的移动机器人。
推荐理由:文章梳理了FCC限制如何从采购传导到机器人架构选择,对评估本地推理与供应链策略有参考价值。
树莓派官方博客介绍基于 DEEPX DX-M1M NPU 的 Sixfab AI HAT+,为 Raspberry Pi 5 提供 25 TOPS AI 算力,典型持续 NPU 功耗约 3 W,并保留 CPU 处理相机、应用逻辑与连接。
推荐理由:原文给出 DX-M1M 与 DX-M1 在 CNN 与 Qwen3-1.7B 上的实测数据和 3 W 功耗口径,可为边缘 AI 加速选型提供对照。
作者用199元开放协议蓝牙AI录音卡、阿里达摩院FunASR和私有化部署的DeepSeek,搭出一套本地存储、离线识别的语音转写与会议纪要系统,全程数据不上云。
推荐理由:文章给出录音卡蓝牙协议分层解析和 FunASR 本地部署命令,可迁移到同类离线语音转写系统的搭建。
DEBIX M8391-01 工业 SBC 搭载 MediaTek MT8391(Genio 720)SoC,配 NPU850 AI 加速器,算力达 9 TOPS,可本地运行视觉、transformer 与 LLM 推理。
魔芯科技的4D世界模型MoWorld随华为Mate 90系列发布进入消费端,鸿蒙独占应用「摸小宠」可将几张手机拍摄的宠物照片生成可任意视角浏览的4D数字猫。技术上采用端云协同,云端昇腾NPU生成3D高斯模型,约6亿参数的MoWorld-2.0-Flash经量化裁剪后跑在麒麟芯片上完成端侧渲染,推理成本约为进口GPU方案的30%。
文章认为AI会取代把需求翻译成能跑代码的工作方式,但工程经验反而更值钱。文中汇总多组实验:大模型在126道嵌入式小练习上最强的DeepSeek-R1只做对55.6%,无硬件反馈时Claude Opus 4.7、Gemini 3.1 Pro等模型十轮内一次都没部署成功;16名资深开发者用AI后实测反而慢了19%,新手测验分数低了17%。
推荐理由:原文汇总了多组大模型写嵌入式代码的实测与对照实验,可用于判断AI在硬件相关任务上的真实边界。
研究提出激活对齐(activation alignment)方法,通过在合成无标签数据上训练一个轻量线性变换,将使用部分上下文的"学生"模型的中间激活映射向使用全部数据的"教师"模型,训练对齐器无需 GPU,在普通硬件上数秒至数分钟即可收敛。
LoGRA 通过低秩梯度草图保留有效学习信号,将 LLM 强化学习后训练的平均训练内存最多降低 45.7%,且不损失性能。该方法配合 predicted-KL 步长控制,在单个八 GPU 节点上稳定训练 27B 参数模型超过 1,100 步,而 dense Adam 会显存耗尽,使原本内存不可行的 RL 训练变得可行。代码已在相关库中开源。
开源 ESP-SDR 固件绕过 ESP32 的 Wi-Fi/蓝牙调制解调器,直接从内部 ADC 信号链采集原始 I/Q 基带采样,无需外接 SDR 硬件即可把 ESP32 变成软件定义无线电接收机。
推荐理由:固件通过逆向 librftest 的 adctrig 调试寄存器让 ESP32 直采 I/Q,为低成本 SDR 方案提供了可复用的实现路径。
LLM-as-Jev 框架在 Qwen3.5-4B 和 Qwen3-0.6B 上验证了通用 LLM 无需训练即可直接输出校准的分类决策,4B 模型免训练表现与同底座社区 Jev 式模型持平,且优于 letter-logit 读出方式,支持任意选项数量并原生处理图像多模态决策。
贺老师基于 STM32H743(Cortex-M7 内核,带 DSP 指令)完成 TinyML 开发板,用 TensorFlow Lite Micro 部署模型,规划麦克风、IMU、模拟量、摄像头四类传感器入口。
一块用于学习 TinyML 的开发板至少应包含计算、数据采集、结果展示、通信和控制四部分。STM32H743 端侧 AI 开发板定位 TinyML 嵌入式 AI 模型部署实战学习板,覆盖从模型部署到硬件落地的完整链路。