28 августа технологический гигант Tencent анонсировала выпуск своей новейшей большой языковой модели Hunyuan-Hy4 preview, которая знаменует значительный скачок в развитии китайских систем искусственного интеллекта. Новинка ориентирована на решение сложных вычислительных задач и глубокую аналитику данных, предлагая пользователям расширенные возможности в рамках экосистемы Tencent Hunyuan.
Технические характеристики и архитектура Mixture-of-Experts
Представленная модель базируется на архитектуре с использованием 770 миллиардов параметров, однако благодаря оптимизации лишь 49 миллиардов из них остаются активными во время выполнения конкретных запросов. Это позволяет сохранять высокую производительность при умеренных затратах вычислительных ресурсов. Одной из ключевых особенностей Hy4 preview является поддержка длины контекста более 1 миллиона токенов, что позволяет нейросети обрабатывать огромные массивы документов, длинные программные коды и целые книги за один запрос.
Разработчики выделили несколько приоритетных направлений применения новой модели:
- Программирование: написание кода, рефакторинг и поиск ошибок в сложных архитектурах.
- Офисные приложения: автоматизация рутинных задач, анализ отчетности и создание структурированного контента.
- Научные исследования: обработка специализированной литературы и помощь в проведении комплексных изысканий.
Экономическая эффективность и ценообразование
Помимо технических достижений, Tencent представила конкурентоспособную модель монетизации API для корпоративных клиентов и разработчиков. Стоимость использования ресурсов модели сбалансирована с учетом объема обрабатываемых данных. Использование технологии кэширования позволяет существенно снизить операционные расходы для повторяющихся запросов.
Актуальные тарифы на момент запуска составляют:
- 6 юаней за 1 миллион входных токенов;
- 18 юаней за 1 миллион выходных токенов;
- 0,3 юаня за 1 миллион токенов при попадании в кэш.
Релиз Hy4 preview демонстрирует стремление Tencent укрепить позиции на рынке LLM (Large Language Models), конкурируя с ведущими мировыми аналогами. Увеличение объема обучающих данных и работа над глубиной понимания контекста делают эту модель важным инструментом для цифровой трансформации бизнеса и академической среды в ближайшей перспективе.