CAIR发布多模态临床智能体CARES 4.0,刘宏斌谈其从工具升级为智能体
CAIR在香港具身智能医疗科技论坛上发布多模态临床智能体系统CARES 4.0,基于Harness智能体框架和自研CT、核磁、超声、内镜、脑电多模态医疗基座构建,已在多家三甲医院完成落地验证,官网已开放、框架与通用工具包已发布。
推荐理由:访谈对比了3.0与4.0的差别并给出幻觉治理思路,可迁移给做垂直领域智能体的团队。
CAIR在香港具身智能医疗科技论坛上发布多模态临床智能体系统CARES 4.0,基于Harness智能体框架和自研CT、核磁、超声、内镜、脑电多模态医疗基座构建,已在多家三甲医院完成落地验证,官网已开放、框架与通用工具包已发布。
推荐理由:访谈对比了3.0与4.0的差别并给出幻觉治理思路,可迁移给做垂直领域智能体的团队。
华为全联接大会推出OceanStor M900,英伟达也已推出CMX Context Memory Storage,KV Cache外置存储成为行业共识。业内估算DRAM与企业级SSD同容量成本相差数十倍,替换比例可达1:N甚至一比五、一比十。但面向KV Cache优化的SSD尚无统一标准,耐写要求从3 DWPD到9 DWPD反复变化,业内预计形成产品共识还需6至12个月,产品开发验证再需约1年。
推荐理由:文章梳理了KV Cache外置存储的成本账与标准缺失现状,涉及具体DWPD指标和时间预期,便于评估相关采购决策。
斯坦福大学助理教授吴佳俊在 IROS 2026 RoBoWoMo 研讨会发表受邀报告《Building Physical Agents via Structured Representations》,以洗盘子场景说明机器人需应对初始状态的定性差别与新观测。
推荐理由:演讲把结构化表征定位为可迁移的中间接口而非硬约束,对做机器人学习框架的人有方法论参考。
IROS 2026 上,银河通用 GaLbot 团队与清华大学、北京大学、上海启智研究院和上海人工智能实验室提出 LATENT,让 Unitree G1 从 5 名业余球员在 3米×5米区域采集的约 5 小时不完美动作数据中学习网球能力。
推荐理由:文中给出成功率、消融和真机限定条件,读者可据此判断该方法的真实能力边界。
文章对 IROS 2026 进入正式议程的 1933 篇论文做多标签梳理,Robot Learning / Embodied AI 约 809 篇、Navigation / Planning 564 篇、Humanoid / Legged 约 213 篦,指出大模型并没有吃掉机器人学,学习、感知、规划、控制与操作正深度交织。
推荐理由:对1933篇论文的多标签统计给出了各方向的篇数与交叉数据,可据此判断机器人研究的真实重心分布。
IROS 2026 主会于当地时间 9 月 30 日在美国匹兹堡落幕,最佳论文颁给 Yumin Lee、Hyoseok Ju 和 Giseop Kim 的《LT-Mem。
推荐理由:梳理了最佳论文与各专项奖的分布,可看出机器人研究正从展示单一能力转向在真实环境中持续工作。
卡尔动力在棋盘井镇宣布启动规模化AI运输网络,将有人驾驶重卡、保留驾驶舱的无人卡车和无驾驶舱运输机器人纳入同一系统。其无人运输车队已达百台量级,业务覆盖6个省份,与30家客户、8家车企和约30家生态伙伴合作,单车经济效益有望从20%提升至30%以上,编队相较人工运输可带来约10%—18%的毛利改善。
推荐理由:文章拆解了编队运输的成本结构与运营细节,便于评估无人货运规模化的实际路径。
Visible Touch 论文提出把接触信号暴露在策略已关注的同一空间坐标系中,使任何图像条件策略无需架构改动即可直接利用触觉信息,并配套开源一款用现成零件经参数化 CAD-to-mold 流水线制造的低成本磁性接触传感器。
推荐理由:论文给出把接触信号嵌入策略已有视觉坐标系的做法与开源低成本传感器,读者可据此评估无需改动架构的触觉接入路径。
论文提出基于 JEPA 的机器人世界模型 RoboJEPA,在覆盖 12 种机器人本体的大规模真实机器人数据集上训练,其想象误差(latent rollout 误差)随算力呈二阶幂律,可在拟合规模之外预测模型质量。
推荐理由:论文给出想象误差随算力的二阶幂律,为评估多本体世界模型规模提供了可迁移的预测方法。
RLHND 提出一种基于视频基础模型的手部跟踪模型,从单目第一人称视频中联合估计手部位姿与真实触觉信息。它把预训练的 Cosmos 3 视频扩散主干通过 clean-latent 条件化改造成确定性的片段级特征提取器,位姿流预测解剖学上合理的关节角度并支持形状参数条件化,触觉流在位姿流冻结下预测手表面的密集接触与力。
推荐理由:论文说明了用视频基础模型补上接触与力线索的思路,关注人视频用于机器人策略训练的读者可了解其方法路径。
论文提出从多向量视觉文档检索器存储的索引中反演还原原始页面,把反演建模为条件文档图像生成。在 ViDoRe v3 基准上,从原始索引反演的页面可恢复 47% 的词和 45% 的敏感 token,用作查询时 98.4% 能把源页面排在首位。
推荐理由:论文用实验量化了多向量文档索引的反演风险,并测试了两种低成本防护的实际效果,做文档检索系统安全评估时可参考其方法。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
Anthropic 发布 Claude Haiku 5.5,官方跑分逐项超过 GPT-6 Luna,并超越 DeepSeek V4.1 Flash 和 GLM-5.3-Flash 成为新的小模型守门员。
推荐理由:文章列出五处API迁移变动和具体跑分,从Haiku 4.5升级的团队可据此评估改动成本。
Efinix 推出 Sapphire RV64 SoC,这是一款面向 Titanium、Topaz 和 Trion(T20 及以上)FPGA 的可配置 64 位 RISC-V 软核,基于 VexiiRiscv,可配置 1 至 4 个核心,主频最高 400 MHz。
推荐理由:原文列出了主频、缓存、内存支持和外设配置,做 FPGA RISC-V 选型的工程师可据此评估是否替换现有 32 位方案。
文章认为自动驾驶能迁移给具身智能的是约50%的技术基建和方法论,但那张时间表不该一起搬。光象科技CEO张涛指出迁移部分落在数据采集、清洗、端到端训练、仿真验证和真机测试流程上,而接触类任务是机器人独有的难点;自变量王潜认为自动驾驶难点在导航和运动,机器人难点在操作,视觉只差几像素的两瓶水在动作层面就是两件事。
推荐理由:原文用50%迁移比例、仿真真机成功率落差和出货量对比,拆解了自动驾驶方法论能给具身智能留下什么、带不走什么。
OpenAI 在 GitHub 开源项目库 math,放出 722 篇由内部未发布前沿模型产出的数学手稿,覆盖 372 个此前未解的难题家族,其中 Result 003 证明了准黎曼猜想(所有狄利克雷 L-函数在实部 ℜ s > 7/8 半平面内无零点)并同步给出 Lean 形式化验证。
推荐理由:梳理了成果清单与数学界反应,可快速了解这批手稿覆盖的问题范围和争议焦点。
9月15日arXiv出现论文《BRIDGE:An Open-Source Humanoid Platform via Morphology-Control Co-Design for Physical AI》,Skild AI两位创始人参与创作,展示了一台高88厘米、13公斤的开源人形平台,硬件图纸、控制策略、训练脚本全部公开。
推荐理由:文章梳理了Skild AI从卖大脑到开源参考身体的路径,并与宇树、智源的同类做法对比,便于理解接口之争。
法国 AI 公司 Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿、混合专家架构每 token 激活 490 亿参数,权重月底全部开源。
推荐理由:原文汇总了多项第三方评测分数与安全基准数据,便于横向比较其与闭源旗舰的差距。
TI 宣布其广泛嵌入式产品组合已全面支持 Zephyr RTOS,覆盖全系列 MCU(从超低功耗 M0 到高性能 M33 内核)、MPU 及无线连接设备,提供统一且可量产的开发平台。
推荐理由:梳理了TI全面支持Zephyr对开发者、生态和行业三层影响,可作为评估厂商中立模式的参考。
文章对比爱芯元智AX8850与瑞芯微RK3588在端侧AI推理上的实测表现,引用双方官方benchmark数据,AX8850在YOLOv5s、YOLOv8n等模型上FPS达到RK3588单核的7~12倍。
推荐理由:原文用双方官方benchmark的同模型FPS对比,把标称TOPS与实际推理性能的差距讲清楚,可迁移为选型时看实测数据的方法。