Kimi K3与GPT-5.6 Sol在DeepSWE基准测试中表现对比:成本、编码与路由效率

Together AI·38 天前

Together AI近期发布了一项针对Kimi K3和GPT-5.6 Sol模型的深度评估报告。该测试基于DeepSWE基准,共执行了904次任务运行。分析表明,GPT-5.6 Sol在单次尝试通过率(pass@1)上表现更优,展现了其在首次响应中的精准编码能力。然而,Kimi K3在四次尝试通过率(pass@4)中脱颖而出,尤其在成本效益方面显著,其单位美元解决的代码问题数量是Sol的2.8倍,突显了其在多次迭代场景下的经济性与稳定性。此外,通过智能路由策略结合两款模型,整体任务完成率提升至约85.6%,为开发者提供了高效、低成本的AI编码解决方案参考。这项测试结果或有助于企业根据实际需求,在性能与成本间做出更明智的模型选择。

大模型代码生成性能评测成本优化Together AI

原文来源:https://www.together.ai/blog/kimi-k3-vs-gpt-5-6-sol-on-deepswe-cost-coding-and-routing

相关阅读

GLM-5.3 Flash成本效益显著:仅牺牲少量性能,成本骤降17倍
GLM-5.3与Claude Fable 5代码能力对决:成本优势明显
GLM-5.3 与 GPT-5.6 Sol 在 DeepSWE 基准测试中成本与性能对比
DeepSeek V4 Pro 与 Claude Fable 5 在 DeepSWE 基准测试中展开成本与性能较量
DeepSeek V4 Pro与GPT-5.6 Sol代码能力对比:成本与性能的博弈

← 返回