Компания SpaceX приняла решение изменить стратегию эксплуатации своего вычислительного кластера и передать мощности центра обработки данных Colossus 1 в аренду сторонним разработчикам. Основной причиной такого шага стали технические сложности, возникшие в процессе обучения и масштабирования ИИ-модели Grok, что вынудило руководство искать альтернативные способы использования дорогостоящей инфраструктуры.
Сетевые задержки и инфраструктурные барьеры
По данным инсайдеров из Fenghuang News Technology, при попытке интеграции Colossus 1 в единую сеть с другими центрами обработки данных инженеры столкнулись с критической проблемой — высокой сетевой задержкой (latency). Технические специалисты связывают это с использованием устаревших компонентов сетевой инфраструктуры, которые не обеспечивают необходимую пропускную способность для синхронного обучения крупномасштабных языковых моделей.
- При попытке распределенного обучения возникала рассинхронизация данных.
- Инфраструктура не выдерживала пиковых нагрузок при обмене информацией между узлами.
- Затраты на модернизацию текущей архитектуры были признаны нецелесообразными в краткосрочной перспективе.
Партнерство с Anthropic и Google
Вместо продолжения попыток адаптации кластера под внутренние нужды Grok, SpaceX заключила соглашения с крупными игроками рынка искусственного интеллекта. Основным арендатором стала компания Anthropic, специализирующаяся на создании безопасных ИИ-систем. Кроме того, сообщается о достижении договоренностей с Google относительно совместного использования вычислительных ресурсов.
Эксперты отмечают, что для Anthropic это соглашение станет возможностью быстро расширить свои обучающие мощности без необходимости строительства собственных дата-центров с нуля.
Перераспределение ресурсов между SpaceX, Anthropic и Google может изменить ландшафт рынка облачных вычислений в сегменте ИИ, где доступ к производительному железу остается главным дефицитом.
Ожидается, что передача мощностей в аренду позволит SpaceX компенсировать расходы на содержание Colossus 1 и сосредоточиться на устранении архитектурных недостатков собственной нейросети. В долгосрочной перспективе компания может вернуться к самостоятельному использованию кластера после глубокой модернизации сетевых протоколов и обновления аппаратной части.