AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
性能评测
4 篇相关内容
相关话题
大模型
成本效益
代码生成
Together AI
大语言模型
Qwen
智能体
开源模型
编程能力
DeepSeek
成本优化
GLM-5.3 与 GPT-5.6 Sol 在 DeepSWE 基准测试中成本与性能对比
Together AI 最新测试显示,在 904 次 DeepSWE 任务中,GLM-5.3 以一半成本实现 pass@4 领先,而 GPT-5.6 Sol 在 pass@1 上略胜一筹。
T
Together AI
·
12 天前
大语言模型
性能评测
成本效益
代码生成
T
消费级显卡也能跑出“Opus级”智能体?Qwen3.8-27B多项榜单反超Claude
Qwen3.8-27B模型在多项评测中超越Claude,并能在消费级显卡上运行类似Opus级别的智能体,推理能力还可根据需求进行自定义。
量
量子位
·
19 天前
Qwen
大模型
智能体
性能评测
量
DeepSeek-V4 Flash 与 GPT-5.6 Luna 成本与性能对比:编程效率谁更胜一筹?
在 DeepSWE 编程基准测试中,GPT-5.6 Luna 在通过率上领先 14 个百分点,但 DeepSeek-V4 Flash 在单位成本下能解决 4.8 倍的问题。
T
Together AI
·
27 天前
大模型
性能评测
成本效益
编程能力
T
Kimi K3与GPT-5.6 Sol在DeepSWE基准测试中表现对比:成本、编码与路由效率
Together AI对Kimi K3和GPT-5.6 Sol进行了904次DeepSWE测试,结果显示Sol在单次通过率领先,而Kimi K3在四次通过率中胜出,且单位成本效率高出2.8倍,两者路由组合性能达85.6%。
T
Together AI
·
38 天前
大模型
代码生成
性能评测
成本优化
T