Together AI 升级GPU集群:增强生产环境可靠性与控制能力

Together AI·5 天前

近日,Together AI 官方发布了其GPU集群服务的重要更新,重点提升了生产环境的可靠性与用户控制能力。新功能主要包括:被动健康检查机制可实时监控GPU节点状态,自动检测硬件异常;节点修复功能能在发现问题时自动重启或替换故障节点,减少人工干预;Slurm调度器的可靠性得到加强,确保大规模任务队列的稳定运行。此外,新增的OIDC(OpenID Connect)认证支持企业级安全集成,而自定义启动脚本功能则允许用户更灵活地配置集群环境。这些改进旨在为AI研发团队提供更稳定、可控的GPU计算资源,降低生产环境中的运维风险,特别适用于需要长时间运行的大模型训练和推理任务。Together AI表示,此次升级是其构建企业级AI基础设施的重要一步。

GPU集群Together AIAI基础设施生产环境可靠性

原文来源:https://www.together.ai/blog/new-in-together-gpu-clusters-reliability-and-control-for-production-gpu-clusters

相关阅读

Together AI与YC合作推出首个YC社区专属GPU集群
AI推理服务可用性解读:99.9%正常运行时间意味着什么?
Together AI 首发 Thinking Machines Lab 新模型 Inkling
Together AI完成8亿美元C轮融资,加速开源AI生态发展
Together AI 八篇论文入选 ICML 2026,展示全栈前沿研究

← 返回