Nanbeige4.2-3B:探索通用Agent小模型

AI-Agent1个月前发布 AIGCOPEN
624 0 0
Nanbeige4.2-3B:探索通用Agent小模型

 

文章摘要


【关 键 词】 小模型智能体强化学习预训练模型架构

面对大尺寸语言模型在处理复杂智能体任务时面临的高昂推理成本,Nanbeige4.2-3B致力于在3B参数的轻量级约束下,全面掌握代码智能体、办公智能体、复杂工具调用及通用推理能力。在不增加参数量的前提下,该模型创新性地采用Looped Transformer架构,通过隐藏状态的循环计算提高有效计算深度与模型容量,并配合扩展至28T tokens的预训练语料,在多项推理与知识评测中实现了同规模最佳表现。

为应对智能体任务对环境的依赖,研发构建了环境与任务联合扩展的高质量数据管线。在代码场景中,依托真实仓库重建沙箱环境,结合多种执行框架生成轨迹并形成训练与数据补充的闭环;在工具调用方面,融合真实在线服务与本地模拟工具,使任务难度随模型能力动态演化;在办公场景中,通过构建跨格式素材库并回收执行产出,逐步生成跨文件依赖更强、流程更长的复杂任务。

在后训练环节,模型通过精细的策略兼顾了推理与智能体能力的深度优化。监督微调阶段引入屏蔽机制,使模型在保留真实错误上下文的同时避免学习错误动作。强化学习阶段则实施多阶段训练配方,涵盖双模式人类反馈强化学习以规范行为、带长度控制的推理强化学习以减少无效思考,以及结合最终结果与单步过程奖励的智能体强化学习,从而显著提升了任务完成率并优化了输出效率。

综合评测显示,Nanbeige4.2-3B在通用与代码智能体评测中稳定超越部分更大参数量的开源模型,并在本地个人助手的办公工作流场景中优势显著。该模型现已全面开源并适配多种主流推理引擎,充分验证了小尺寸模型在高频调用、本地部署及成本敏感场景中的独立应用价值,为智能体技术的低成本落地提供了切实可行的解决方案。

原文和模型


【原文链接】 阅读原文 [ 3174字 | 13分钟 ]
【原文作者】 AIGC开放社区
【摘要模型】 qwen3.7-max-2026-06-08
【摘要评分】 ★★★★★

© 版权声明
xunfeiagent

相关文章

trae

暂无评论

暂无评论...