DeepSeek V4 Pro 与 Claude Fable 5 在 DeepSWE 基准测试中展开成本与性能较量

Together AI·16 天前

近日,Together AI 发布了一项针对两大前沿模型——DeepSeek V4 Pro 0813 和 Claude Fable 5——在 DeepSWE(深度软件工程)基准测试上的对比分析。研究团队共执行了 904 次测试任务,以评估两者在代码生成与问题解决方面的性能与成本效率。

结果显示,Claude Fable 5 在首次尝试成功率(pass@1)上表现最佳,但其计算成本高达 DeepSeek V4 Pro 的约 90 倍。而 DeepSeek V4 Pro 则在四次尝试成功率(pass@4)指标上反超,展现出更强的迭代优化潜力。

值得注意的是,研究提出了一种“Pro 优先级联”策略:先使用成本较低的 DeepSeek V4 Pro 进行处理,仅在其失败时调用高成本的 Claude Fable 5。该混合方案在测试中实现了 82.7% 的整体成功率,在控制成本的同时显著提升了任务完成率。这一发现为实际部署中平衡性能与开销提供了有价值的参考。

大模型评测代码生成成本优化DeepSeekClaude

原文来源:https://www.together.ai/blog/deepseek-v4-pro-0813-vs-claude-fable-5-on-deepswe-cost-coding-and-routing

相关阅读

GLM-5.3 Flash成本效益显著:仅牺牲少量性能,成本骤降17倍
GLM-5.3与Claude Fable 5代码能力对决:成本优势明显
GLM-5.3 与 GPT-5.6 Sol 在 DeepSWE 基准测试中成本与性能对比
DeepSeek V4 Pro与GPT-5.6 Sol代码能力对比:成本与性能的博弈
生产环境模型A/B测试新策略:端侧分流更精准

← 返回