OmniTools 8月14日消息,蚂蚁百灵与 ASystem 团队合作,在 DGX Spark 平台上基于 Ling-3.0-tiny 模型和 AReno 框架,完成了单机环境下的 Agentic 强化学习(Agentic RL)后训练闭环验证。实验以井字棋为最小可行任务,采用 GSPO 算法训练 400 步后,rollout/rewards_mean 指标由约 -0.5 提升至 0.4,响应长度降至约 850 tokens,工具调用与动作选择稳定性增强。
OmniTools 8月14日消息,蚂蚁百灵与 ASystem 团队合作,在 DGX Spark 平台上基于 Ling-3.0-tiny 模型和 AReno 框架,完成了单机环境下的 Agentic 强化学习(Agentic RL)后训练闭环验证。实验以井字棋为最小可行任务,采用 GSPO 算法训练 400 步后,rollout/rewards_mean 指标由约 -0.5 提升至 0.4,响应长度降至约 850 tokens,工具调用与动作选择稳定性增强。
从这条动态出发,继续查看相关分析、产品详情和同主题更新。
刚收录的 AI 工具,适合顺手发现可用产品。