Cognition发布SWE-2编程模型,成本为竞品四分之一

发布时间:2026-09-11 10:36  点击:1次
Cognition发布SWE-2编程模型,成本为竞品四分之一

Cognition公司于9月10日正式发布SWE-2代码生成模型。该模型在刚完成超20亿美元E轮融资、估值达480亿美元的背景下推出,旨在打破头部厂商对前沿代码能力的垄断。根据官方技术博客披露的数据,SWE-2在核心基准测试中的表现已逼近Anthropic的Fable 5.1与OpenAI的GPT-6 Astra,但单次任务运行成本仅为后者的四分之一左右。

性能逼近头部竞品,成本结构实现重构

SWE-2的性能数据直接对标当前市场主流大模型。在FrontierCode 1.1 Main测试中,SWE-2取得50.0%的得分,仅落后于Fable 5.1与GPT-6 Astra;在DeepSWE 1.1榜单中达到73.0%,同样紧随GPT-6 Astra。在Terminal-Bench 2.1中SWE-2以92.8%的成绩位列第一,但在长上下文Shell密集型任务的Terminal-Bench 4中得分为27.3%,官方坦言该场景下仍需优化。价格方面,SWE-2比Fable 5.1便宜64%,约为GPT-6 Astra价格的25%。这种高分低耗的特性,使其在需要高频调用编程代理的企业级场景中具备显著优势。

单轮强化学习与动态成本惩罚机制

SWE-2的技术底座源自月之暗面开源的Kimi K33模型,并在其基础上进行了深度后训练。Cognition的核心突破在于训练架构的重构:传统做法是按难度分级训练独立专家模型再合并,而SWE-2采用单轮强化学习流程,覆盖低、中、高、最高四种推理强度档位。系统引入基于帕累托前沿的成本线性惩罚机制,使模型在训练过程中自动学习不同精度与算力消耗之间的最优平衡点。配合DSpark推测解码技术与NVFP4及FP8量化感知训练,模型在降低KL散度的提升了Token接受率,最终实现吞吐量与上一代SWE-1.7持平,但推理偏差大幅收窄。

在实际工作流中,SWE-2的行为模式发生实质性改变。中等强度模式下,模型首次执行有效代码编辑的中位步数从SWE-1.7的48步骤降至18步,整体对话轮次减少58%,平均任务成本下降81%。内部测试显示,该模型倾向于快速定位关键模块并提前输出,而非盲目遍历全仓库;当外部工具链中断时,它能通过历史日志或本地缓存重建上下文;面对质疑时则采用重新推导而非重复确认的策略。这些特征直接降低了自动化代码审查与重构流程中的试错成本。

从市场竞争格局来看,SWE-2的发布恰逢Anthropic与OpenAI密集推出新一代模型。Fable 5.1与GPT-6 Astra均采用百万级上下文窗口,定价均为每百万输入输出Token十美元与五十美元。两者在精度上仍占优,但Cognition凭借近九亿美元的年化营收增速与自建独立代理实验室的战略,正转向基于开源基座模型定制垂直场景的方案。目前其企业客户涵盖英伟达、通用航空、花旗集团、梅赛德斯-奔驰等机构,且内部工程师提交的代码中已有百分之八十九由自家Devin编程助手自动生成。

对于国内软件开发团队与技术采购方而言,评估此类编程代理需跳出传统的Token计价逻辑。实际部署时应重点核算单任务解决成本,结合缓存命中率与提示词压缩效率进行综合测算。若业务依赖Devin生态,建议优先申请Web端、Fusion平台与命令行工具的早期访问权限,在自有代码库中进行对比测试。不同模型在特定开发框架下的表现存在差异,更换基座前务必使用真实工作负载跑通完整验证链路,避免因评测基准不一致导致选型偏差。

SWE-2的量产落地仍需在长上下文稳定性与复杂环境兼容性上持续迭代。企业在引入该类模型时,应建立明确的成本监控阈值与人工复核节点,防止过度依赖自动化输出引发架构债务。随着强化学习调度策略的成熟,未来编程代理的边际服务成本有望进一步下探,但核心代码安全审计与版本控制规范仍是不可妥协的工程底线。

东莞集思网络公司

联系人:
曹洋(先生)
手机:
13760111111
地址:
上海曹杨路
我们发布的其他软件新闻更多
13760111111 请卖家联系我