OpenAI и Cerebras ускорили GPT-5.6 Sol до 750 токенов в секунду

OpenAI и Cerebras анонсировали новый режим обработки запросов Ultrafast для модели GPT-5.6 Sol. Он появился в OpenAI API и позволяет генерировать до 750 выходных токенов в секунду.
По словам компаний, это до 14 раз быстрее стандартного режима. Ускорение достигается за счет запуска полной модели на инфраструктуре Cerebras, а не использования облегченной версии. Cerebras задействует собственные чипы для инференса, что и дает прирост скорости.
Разработчики подчеркивают, что качество ответов не снижается. Для пользователей это означает, что можно получить быстрый ответ без потери точности, что критично для задач реального времени.
Пока режим Ultrafast доступен ограниченной группе клиентов. Коммерческие условия и стоимость не раскрыты. Видимо, OpenAI сначала протестирует спрос, прежде чем открыть широкий доступ.
Это не первый пример сотрудничества OpenAI с Cerebras. Ранее компания уже использовала их решения для ускорения вычислений. Новый режим может усилить позиции OpenAI на рынке API, где скорость обработки запросов становится одним из ключевых факторов.
Для крупных языковых моделей скорость инференса часто является узким местом. Ultrafast показывает, что можно существенно ускорить работу без компромиссов по качеству, если правильно подобрать аппаратное обеспечение.







