Kimi K3与GPT-5.6 Sol在DeepSWE基准测试中表现对比:成本、编码与路由效率
Together AI近期发布了一项针对Kimi K3和GPT-5.6 Sol模型的深度评估报告。该测试基于DeepSWE基准,共执行了904次任务运行。分析表明,GPT-5.6 Sol在单次尝试通过率(pass@1)上表现更优,展现了其在首次响应中的精准编码能力。然而,Kimi K3在四次尝试通过率(pass@4)中脱颖而出,尤其在成本效益方面显著,其单位美元解决的代码问题数量是Sol的2.8倍,突显了其在多次迭代场景下的经济性与稳定性。此外,通过智能路由策略结合两款模型,整体任务完成率提升至约85.6%,为开发者提供了高效、低成本的AI编码解决方案参考。这项测试结果或有助于企业根据实际需求,在性能与成本间做出更明智的模型选择。
原文来源:https://www.together.ai/blog/kimi-k3-vs-gpt-5-6-sol-on-deepswe-cost-coding-and-routing