2026 Retrocomputing Challenge:复古终端台式街机顶盖
Hackaday 2026 Retrocomputing Challenge 参赛作品 Retro Terminal Bartop Arcade Topper 将台式街机柜的街机按键与摇杆面板换成带机械键盘、触摸板和 USB 分线口的面板,可在街机模式与复古终端模式间切换。终端模式采用 cool-retro-term 模拟器,并配有一张两侧带 5.25″ 软驱图案的宽屏壁纸,可在项目页面下载。
Hackaday 2026 Retrocomputing Challenge 参赛作品 Retro Terminal Bartop Arcade Topper 将台式街机柜的街机按键与摇杆面板换成带机械键盘、触摸板和 USB 分线口的面板,可在街机模式与复古终端模式间切换。终端模式采用 cool-retro-term 模拟器,并配有一张两侧带 5.25″ 软驱图案的宽屏壁纸,可在项目页面下载。
清华背景公司 Naive AI(工商注册名北京智衍慧生科技有限公司)成立 7 个月完成三轮融资共 4 亿美元,投后估值 14.2 亿美元,投资方包括腾讯、博裕、红杉中国、IDG、经纬、君联资本等。
推荐理由:梳理了团队从 MSRA、商汤到上海 AI Lab 的十年合作脉络,可理解资本押注这支队伍的依据。
左林右狸频道撰文回顾张磊的职业经历:清华本硕博期间做AGV,1999年进入MSRA实习,2001年加入张宏江组,2002年在人脸检测赛马中带实习生击败李子青团队,三个月内把误报率降到1%,方案集成进Windows。
CAIR在香港具身智能医疗科技论坛上发布多模态临床智能体系统CARES 4.0,基于Harness智能体框架和自研CT、核磁、超声、内镜、脑电多模态医疗基座构建,已在多家三甲医院完成落地验证,官网已开放、框架与通用工具包已发布。
推荐理由:访谈对比了3.0与4.0的差别并给出幻觉治理思路,可迁移给做垂直领域智能体的团队。
华为全联接大会推出OceanStor M900,英伟达也已推出CMX Context Memory Storage,KV Cache外置存储成为行业共识。业内估算DRAM与企业级SSD同容量成本相差数十倍,替换比例可达1:N甚至一比五、一比十。但面向KV Cache优化的SSD尚无统一标准,耐写要求从3 DWPD到9 DWPD反复变化,业内预计形成产品共识还需6至12个月,产品开发验证再需约1年。
推荐理由:文章梳理了KV Cache外置存储的成本账与标准缺失现状,涉及具体DWPD指标和时间预期,便于评估相关采购决策。
RLHND 提出一种基于视频基础模型的手部跟踪模型,从单目第一人称视频中联合估计手部位姿与真实触觉信息。它把预训练的 Cosmos 3 视频扩散主干通过 clean-latent 条件化改造成确定性的片段级特征提取器,位姿流预测解剖学上合理的关节角度并支持形状参数条件化,触觉流在位姿流冻结下预测手表面的密集接触与力。
推荐理由:论文说明了用视频基础模型补上接触与力线索的思路,关注人视频用于机器人策略训练的读者可了解其方法路径。
Hackaday 介绍了 [Charlysan] 用 RP2350 制作的 TTL 转 DVI 转换器,解决有 TTL 显示卡却找不到兼容显示器的问题。
雷锋网对话如祺出行COO韩锋,阐述其不做大模型、专注做AI数据基础设施的路线。韩锋认为世界模型越强,真实数据越重要,真实数据负责发现与验证未知问题,合成数据负责对已发现问题做定向扩展,两者形成互补闭环。数据业务2026年上半年收入同比增长274.4%,半年收入已超1亿元;2026年6月还推出了处理Ego-centric第一人称操作视频的具身智能数据平台。
斯坦福大学助理教授吴佳俊在 IROS 2026 RoBoWoMo 研讨会发表受邀报告《Building Physical Agents via Structured Representations》,以洗盘子场景说明机器人需应对初始状态的定性差别与新观测。
推荐理由:演讲把结构化表征定位为可迁移的中间接口而非硬约束,对做机器人学习框架的人有方法论参考。
IROS 2026 上,银河通用 GaLbot 团队与清华大学、北京大学、上海启智研究院和上海人工智能实验室提出 LATENT,让 Unitree G1 从 5 名业余球员在 3米×5米区域采集的约 5 小时不完美动作数据中学习网球能力。
推荐理由:文中给出成功率、消融和真机限定条件,读者可据此判断该方法的真实能力边界。
文章对 IROS 2026 进入正式议程的 1933 篇论文做多标签梳理,Robot Learning / Embodied AI 约 809 篇、Navigation / Planning 564 篇、Humanoid / Legged 约 213 篦,指出大模型并没有吃掉机器人学,学习、感知、规划、控制与操作正深度交织。
推荐理由:对1933篇论文的多标签统计给出了各方向的篇数与交叉数据,可据此判断机器人研究的真实重心分布。
IROS 2026 主会于当地时间 9 月 30 日在美国匹兹堡落幕,最佳论文颁给 Yumin Lee、Hyoseok Ju 和 Giseop Kim 的《LT-Mem。
推荐理由:梳理了最佳论文与各专项奖的分布,可看出机器人研究正从展示单一能力转向在真实环境中持续工作。
论文提出 UltraText Bench,一个面向 prompt-only 密集视觉文字生成的双语评测基准,含 432 条提示、24 个真实场景类别和三个难度等级,中英文各占一半,每条提示标注 4 至 12 个文字区域的精确字符串及结构化参考。
论文提出 RobotWorld,一个面向机器人操作的仿真测试基准,包含 84 项任务,覆盖操作、移动操作、运动、驾驶与空中控制,设有明确的交互预算与可执行的成功判定。
RunningTab 提出一种为直接工作区交互(DWI)配备环境侧标签页的框架,由环境记录任务待办项、已读文件摘录及已列出但未打开的文件候选。在三个基准测试、三种 LLM 上的验证中,RunningTab 持续优于普通 DWI 及将记录保存在模型内的基线方法,其标签页通常已包含交付物所需内容。
SWE-Game 推出一个由 247 项任务构成的游戏开发基准,覆盖 41 个可执行的 Godot 参考游戏、13 种 2D 与 3D 玩法类别,任务类型涵盖从需求简报生成游戏、按设计文档实现、骨架补全、83 例注入故障修复以及 Godot 到 Unity 移植。
Tetris3D 提出一种单图 3D 场景重建生成框架,显式以周围物体几何及其物理关系为条件生成每个物体,使形状与位姿在场景中保持几何与物理合理。研究同时发布基于物理仿真的数据集 ComOb,包含 1.2M 个场景,提供逐物体网格与成对物理关系标注。在合成与真实场景实验中,Tetris3D 在交互区域被遮挡时仍能恢复连贯的物体形状与位姿,生成质量与物理稳定性达到 state-of-the-art。
卡尔动力在棋盘井镇宣布启动规模化AI运输网络,将有人驾驶重卡、保留驾驶舱的无人卡车和无驾驶舱运输机器人纳入同一系统。其无人运输车队已达百台量级,业务覆盖6个省份,与30家客户、8家车企和约30家生态伙伴合作,单车经济效益有望从20%提升至30%以上,编队相较人工运输可带来约10%—18%的毛利改善。
推荐理由:文章拆解了编队运输的成本结构与运营细节,便于评估无人货运规模化的实际路径。
论文提出 Systematic Multi-Agent Vision-and-Language Navigation,将多智能体 VLN 首次系统形式化为带依赖与资源约束(presence locks 和 holding chains)的协同问题。
Faster-WAM 提出以视频世界模型为中心、动作专家仅单层的设计,通过 Dock of Transformers (DoT) 配合 Lite KV-Fusion 让轻量动作专家访问所有视频层表征,并采用仅基于世界模型的条件输入与 retracted 1D-RoPE 位置对齐。
论文提出 FAOC 框架,将强化学习与最优控制结合,通过基于优化的映射算法把 RL 智能体的抽象动作转换为最优控制问题中依赖状态的可行参数集,保证参数瞬时可行。配合不变终端集,FAOC 保证严格递归可行与安全运行,且抽象动作空间无需专家调参。在机器人乒乓球实时运动规划的仿真实验中,其样本效率与闭环性能优于现有基线,映射算法与运动规划 OCP 实现已开源。
论文提出 StressDream,通过优化扩散式视频世界模型的初始噪声,将想象引导至推理时以文本指定的高影响但合理的结果(如任务失败),从而实现稳健的策略评估与改进。
一项针对24名驾驶员的驾驶模拟器研究,在触觉共享控制与切换控制两种模式下评估部分自动驾驶系统的有意义人类控制(MHC)。确认性分析显示,驾驶员感知自动驾驶车辆理解自己的程度与转向力矩冲突呈负相关;定性反馈表明意图不匹配、缺乏安全感和对驾驶员输入的阻力会降低感知MHC,而与驾驶员意图一致的细微触觉引导则有正面效果。
论文提出 Safe Sequential QCQP(SS-QCQP)算法,一种针对光滑不等式约束非凸优化的一阶方法,保证每次迭代都可行。该方法在标准约束资格条件下达到 O(1/t) 遍历收敛率,并通过带自适应步长的欧拉离散化在离散时间保持下降与可行性。其活跃集变体 SS-QCQP-AS 显著降低计算成本,多智能体非线性最优控制实验显示解质量与 SQP、IPOPT 等二阶求解器相当。
一篇被 ACM Computer Survey 接收的综述系统梳理了生成式 AI 在自动驾驶全栈中的角色,覆盖 VAE、GAN、Diffusion Models 与 LLM 的原理与取舍,以及图像、LiDAR、轨迹、occupancy、视频生成和 LLM 引导的推理决策等前沿应用。
WBAG 提出一种面向视觉语言动作策略的推理时安全框架,建模机器人全身与抓取相关的附着物体几何,构造随抓取状态变化的安全集,并将其转化为可微的 CBF 约束,对 VLA 的六维操作空间动作做最小修改以避碰。
论文提出社交导航场景理解基准 SocialNav-SUB,一个用于评测 VLM 在真实社交导航场景下理解能力的 VQA 数据集与基准,涵盖空间、时空和社会推理任务,并在统一框架下与人类和规则基线对比。
一项面向机器人运动规划的几何驱动框架实现了对不可行性的有限时间认证,通过有符号距离场在位形空间中追踪障碍边界诱导的分离流形,并结合 GPU 加速的并行前沿扩展算法完成高维单纯复形重建。该方法在 4-DOF 场景中数秒内、5-DOF 场景中四分钟内完成不可行性认证,已被 IEEE Robotics and Automation Letters (RA-L) 接收。
研究提出 WSM-Aware HRI 框架,将人机交互故障统一为世界状态不匹配(WSM),借助 LLM 把隐含假设显式化并映射到少量不匹配类型,从而在意图形成阶段主动检测故障。系统在 10 个日常场景(涵盖视觉与潜在状态不匹配)上评测,可准确产出预期结果;消融实验表明,可靠识别依赖合适的表征与面向验证的细化。
CoRe-WAM 提出 TraceDelta 模块,用冻结跟踪模型的对应关系将历史视觉特征搬运到当前位置再计算带符号差值,仅优化 1.59 million 参数、5,000 次更新适配预算下,在 RoboTwin 2.0 的 50 项任务上 clean 成功率达 92.22%,较 Motus 提升 3.56 个百分点,随机化评测下 89.60%、提升 2.58 个百分点。
Visible Touch 论文提出把接触信号暴露在策略已关注的同一空间坐标系中,使任何图像条件策略无需架构改动即可直接利用触觉信息,并配套开源一款用现成零件经参数化 CAD-to-mold 流水线制造的低成本磁性接触传感器。
推荐理由:论文给出把接触信号嵌入策略已有视觉坐标系的做法与开源低成本传感器,读者可据此评估无需改动架构的触觉接入路径。
论文提出将鲁棒VLA适配视为失败边界学习问题,并给出方法DLS:基于少量真实演示与仿真协同训练构建真实落地的行为先验,通过on-policy数字孪生rollout大规模发现失败边界。
研究将保守贝叶斯推断(CBI)技术扩展到可靠性评估,检验基于运营数据的可靠性声明的稳健性,发现运营数据细节不足会削弱自动驾驶汽车(AV)安全评估中的软件可靠性声明,低保真数据即便保守使用也可能得出危险的乐观结论。作者称给出了数据保真度对可靠性评估影响的首个保守估计。论文共 15 页、12 幅图,分类为 cs.RO 与 cs.SE。
SAIN 提出一种零样本框架,将主动对话转化为持久导航状态,在 VL-LN IIGN 基准上把 SR 从 20.2 提升到 25.4、SPL 从 13.07 提升到 14.17,超过最强的对话式基线且无需任务特定策略训练。该预印本已由作者 YuHao Cao 撤稿,原因是团队内部对现阶段公开发布存在分歧。
论文提出 UniCross 框架,将抓取、重定位、手内旋转和手内平移四项灵巧操作技能统一到共享的状态、动作空间与目标结构中,蒸馏出单一跨技能策略。该策略在四项技能上均表现良好,可泛化到未见物体、抗干扰,并在不切换策略的情况下串联成长程操作,还能跨不同手部形态迁移。
ModPack 提出一套模块化可扩展的遥操作系统,核心是集成机载计算、供电、通信和存储的可穿戴背包,在其上支持即插即用的功能模块,包括带触觉反馈的关节级遥操作、移动操作和主动感知。
论文提出 OptCar,一种把通才前向运动学动力学(FKD)模型特化为特定车辆高速模型预测控制(MPC)的方法,用 FiLM 将多步预测条件化在单个动力学上下文 token 上,并结合少量真实数据与环境系统辨识的合成 rollout 进行特化。
论文提出 VIA(Visual Interface Agent)框架,把机器人控制重新表述为智能体任务,让现成智能体通过由可交互视觉组件构成的虚拟工作区直接驱动机械臂,用鼠标式工具探测像素并指挥虚拟末端执行器设定目标位姿。
CoRL 2026 收录论文提出 Failure-Aware Retry(FAR)框架,让机器人在测试时从既往失败中学习并自主完成任务,避免朴素重试重复同样的错误。
论文提出 MultiSensory World Model(MuSe),通过多阶段融合、多感官未来预测和在预训练数据上的经验回放,把有限的多感官数据注入仅视觉的预训练策略,使其适应新任务并引入新模态,同时保持原有传感器配置下的性能。