arXiv cs.RO 机器人学· Haochuan Wang·· 2 天前AI 评分57
Same Pieces, Different Servers:面向"服务化"AI Agent 的 Tetris 基准测试
Same Pieces, Different Servers: A Tetris Benchmark for AI Agents as Served
AI 导读
研究者提出 Tetris 基准,用同一组方块、以 oracle 评分衡量 AI Agent 从"服务化"模型获得的决策质量。在一家 serverless 供应商上对 9 个开源权重模型做 5 组预设实验,并自托管一个开源决策模型跑在 CPU 上,发现价格与模型规模不预测决策质量;重发历史在缓存输入免费时几乎零成本,若不免费则贵 11-12 倍且让棋局变差。
来源:arXiv cs.RO 机器人学 · arxiv.org