9月11日,腾讯把Qwen3.5-122B-A10B专门拿去练终端Agent,做出了T1。它主要处理Linux终端里的复杂任务,单个任务最多能连续调用工具300多轮。Terminal-Bench2.1得分从底模的43.8%升到64.0%,涨了20.2分。这20.2分里,大头来自强化学习。SFT只把分数拉到49.4%,后面的强化学习又涨了14.6分。团队准备了约1.5万个终端任务,每个任务都配有自动测试。
Agent没把整个任务做完,只要完成了其中一些要求,也能拿到相应奖励。长任务还有一个麻烦。Agent真正干活和之后拿这段经历训练时,同一句内容可能被重新切成不同token,MoE也可能换一批专家处理。T1会把当时生成的token和选中的专家都记下来,训练时直接照着重放,把这种训推偏差压低了约三分之一。
声明:本文所有内容均来源于第三方平台,币圈子对于其内容不作任何类型的保证,不构成任何投资、不对任何因使用本网站信息而导致的任何损失负责。您需谨慎使用相关数据及内容,并自行承担所带来的一切风险。