Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Эффективность вашего ИИ-агента зависит от вашей инфраструктуры

Дата публикации: 28-09-2026 08:01:32

Агентам искусственного интеллекта необходима специализированная инфраструктура. Селена Чеккинель, старший менеджер по маркетингу ...

Основное содержимое страницы с новостью.

pix.gif

5 инструментов, которые помогут управлять проектами в кризис

В кризис компании теряют устойчивость из-за того, что выручка становится нестабильной, а стоимость ресурсов растёт …

CLO запустила обновленное облако с новой архитектурой и изоляцией трафика

8 сентября 2026 года команда CLO, облачного проекта компании FirstVDS, выпустила улучшенную версию платформы. По словам …

Что дает объединение корпоративного поиска, ИИ-ассистента и онбординга в одной архитектуре: опыт Роберта Тантушяна

Эксперт по автоматизированному тестированию, разработавший собственный подход к управлению данными, — о том …

Когда сотрудники находят ответ сами: как ИИ гид-помощник в SimpleOne ITSM разгружает поддержку и бюджет

Портал самообслуживания давно стал привычным элементом корпоративной поддержки. Однако это ещё не означает, что сотрудники …

Названа лучшая студия дизайна интерьера Санкт-Петербурга в 2026 году для IT-специалиста

Мы изучили рынок дизайн-студий и поговорили с коллегами из IT, которые недавно делали ремонт. Вердикт …

kl-red.png
  Эффективность вашего ИИ-агента зависит от вашей инфраструктуры

28.09.2026

Агентам искусственного интеллекта необходима специализированная инфраструктура. Селена Чеккинель, старший менеджер по маркетингу продуктов компании CoreWeave, рассказывает на портале The New Stack о том, как оптимизировать среды выполнения для многоэтапных агентных рабочих процессов.

Вы создали отличного агента, но что-то пошло не так, когда он перешёл в продакшен.

В тестовой среде ваш агент эффективно самостоятельно просматривал запросы на слияние (PR). Он читал различия, искал в коде связанные использования, запускал набор тестов, проверял, не остался ли красный индикатор CI после предыдущего коммита, и составлял комментарий — и всё это до того, как вы сами закончили читать diff.

Однако в продакшене те же пять шагов выполняются в связи с каждым вторым обзором PR, который агенты вашей команды выполняли в течение последнего часа. Некоторые ревью завершаются за секунды; другие задерживаются на минуты, потому что шаг набора тестов попадает на узел, который находился в процессе выполнения агентом другого пользователя.

Агент не меняется. Меняется среда выполнения, и именно это определяет, остается ли время ревью стабильным или увеличивается.

Агентные приложения используют иной шаблон выполнения, чем традиционные чат-приложения. Поскольку их рабочие процессы длиннее и динамичнее, инфраструктура оказывает гораздо большее влияние на задержку, надежность и стоимость, чем в случае простого чат-бота.

Вот почему эффективность вашего агента зависит от вашей инфраструктуры.

Агенты — это не чат-боты с бóльшим количеством шагов

Разница между обслуживанием инференса чат-бота и агента ИИ заключается не просто в том, что один из них «более функционален». Они выполняют работу по-разному:

  • Чат-бот обычно делает один вызов инференса на каждое сообщение пользователя. Модель получает промпт, генерирует ответ и ждет следующего ввода пользователя, прежде чем продолжить.
  • Агент выполняет весь рабочий процесс, превращая одно сообщение пользователя в цепочку вызовов инференса. Он может решить провести поиск в документации, извлечь данные из базы данных, вызвать API, выполнить код, оценить результат, а затем повторить этот процесс, прежде чем выдать ответ. Каждое из этих решений может инициировать еще один вызов инференса, и каждый результат становится дополнительным контекстом для следующего шага.

Такая модель выполнения меняет требования к инфраструктуре для агентов ИИ.

Один вопрос, за которым следует множество шагов

Вместо оптимизации для отдельных запросов инференса система должна поддерживать длительные рабочие процессы, задержка и надежность которых зависят от каждого компонента в цепочке.

Один пользовательский запрос часто разворачивается в последовательность шагов инференса и запуска инструментов, иногда называемых многоэтапными вызовами инструментов или агентным циклом. Вместо генерации одного ответа модель чередует рассуждения и взаимодействия с внешними системами.

Например, вы спрашиваете агента, почему задержка при оформлении заказа резко возросла ночью. Агент берет журнал развертывания, запрашивает систему мониторинга, запускает диагностику пула соединений, оценивает, является ли причиной некорректное развертывание или проблема с пропускной способностью, а затем объединяет это в другой вызов инференса, прежде чем, наконец, выдать полноценный ответ.

Каждый шаг рассуждения становится еще одним запросом инференса, и каждый результат работы инструмента добавляется в контекст модели перед следующим шагом.

Этот рабочий процесс меняет представление о надежности

Многоэтапные рабочие процессы по своей природе последовательны, поэтому даже низкая задержка может быстро привести к значительным потерям. Каждый шаг инференса ожидает завершения предыдущего. Если запрос к базе данных занимает две секунды, модель не может начать следующий шаг рассуждений, пока не получит этот результат. Модель может быстро генерировать токены, но другие шаги замедляют ее.

В этом агентном рабочем процессе каждый шаг в цепочке должен быть безупречным, потому что цепочка сильна настолько, насколько сильно ее самое медленное звено. Вместо обработки изолированных запросов инференса стек инфренса должен координировать цепочку зависимых вызовов модели и вызовов внешних инструментов. По мере того, как эти рабочие процессы становятся длиннее, стек все больше определяет, насколько быстро, надежно и экономично работает приложение.

Но пользователь видит не сбой в оркестрации. Он видит агента, который завис или сдался.

Вот почему сквозная надежность агента зависит от гораздо большего, чем просто качество модели. Инфраструктура определяет, располагает ли каждый шаг необходимыми ресурсами для предсказуемого выполнения под нагрузкой.

Почему и стоимость, и производительность кажутся непредсказуемыми

Второе отличие в агентных рабочих процессах застает команды врасплох: шаблоны спроса и их влияние на стоимость инференса.

Большинство сервисов инференса и ценообразование на его основе предполагают, что трафик поступает с предсказуемой скоростью. Типичное решение для инференса знает предсказуемый шаблон спроса: пользовательский трафик увеличивается, объем запросов увеличивается и пропускная способность масштабируется соответствующим образом. Облачная инфраструктура обычно оптимизируется под такие стабильные шаблоны запросов с использованием таких механизмов, как автомасштабирование, балансировка нагрузки и планирование пропускной способности.

Рабочие нагрузки агентов ведут себя иначе. Отдельные рабочие процессы приостанавливаются в ожидании ответа от внешних систем, а затем возобновляются, как только поступает новая информация.

  • Пауза: агент ожидает ответа от внешнего API или базы данных, поэтому графический процессор (GPU), обслуживающий этот процесс, не выполняет задач по инференсу, а накопленный контекст может быть вытеснен из памяти GPU на время ожидания.
  • Всплеск: как только внешние системы возвращают результаты, инференс возобновляется одновременно для множества процессов, создавая кратковременные и резкие скачки нагрузки на GPU, причем каждый процесс заново обрабатывает весь накопленный контекст.

Если при мониторинге загрузки GPU вы видите картину, напоминающую кардиограмму — ровную линию с резкими скачками в моменты получения результатов от инструментов, — это характерный признак. Это означает, что вы выделяете ресурсы исходя из средних показателей, тогда как нужно ориентироваться на пиковые; именно здесь чаще всего происходит незаметный, но критический рост задержки на уровне 99-го перцентиля (p99).

Сервисы инференса, рассчитанные на стабильные или предсказуемые потоки запросов, могут испытывать трудности с эффективным распределением ресурсов в таких условиях. Это приводит к нестабильной задержке, недоиспользованию GPU или росту эксплуатационных расходов.

Непредсказуемая производительность или счета, не соответствующие ожиданиям, свидетельствуют о том, что ваша инфраструктура была спроектирована для иного типа нагрузки, чем тот, который вы фактически используете.

Как на самом деле выглядит инфраструктура для агентов

Агентные приложения предъявляют к инфраструктуре иные требования, чем традиционные задачи ИИ: длинные цепочки зависимостей, скачкообразный характер нагрузки и постоянное развитие. В таких условиях от инфраструктуры зависит, выдержит ли она цепочку процессов и не превысят ли расходы запланированный бюджет.

Для работы агента необходима инфраструктура, специально созданная для обеспечения следующих возможностей:

  • Стабильная производительность на всей протяженности цепочки. Инфраструктура должна обеспечивать неизменную задержку при выполнении многоэтапных процессов, использующих различные инструменты.
  • Масштабируемость, отвечающая скачкообразным нагрузкам. Инфраструктура должна быстро масштабироваться при колебаниях спроса на инференс, не требуя резервирования мощностей в периоды простоя.
  • Предсказуемые затраты даже при динамических нагрузках. Счет за инфраструктуру должен отражать фактическое потребление ресурсов.
  • Ничто из этого не устраняет скачки нагрузки, но меняет способ их обработки системой. Достаточно мощный одновременный всплеск или рабочий процесс, накапливающий значительный объем контекста перед паузой, все равно требуют определенных затрат. Цель — не нулевые затраты или отсутствие лимитов, а их предсказуемость.

Эффективность вашего агента напрямую зависит от качества инфраструктуры. При грамотном подходе быстродействие, надежность и экономическая эффективность агента станут залогом более продуктивной работы.

Комментарии

Только зарегистрированные пользователи могут оставлять комментарий.

Регистрация
Авторизация

 
pix.gif

Интересно

kl-red.png
pix.gif
kl-blue.png

ИИ-помощник тимлида в закрытом контуре: что меняется в работе

Если тимлид работает с внешними зарубежными моделями, ему нужно выбирать: либо давать ИИ только обезличенные данные …

IDC: тренды индустрии робототехники 2026 года

Навкендар Сингх, вице-президент IDC India по направлениям клиентских устройств и IPDS, рассказывает …

Эффективность вашего ИИ-агента зависит от вашей инфраструктуры

Агентам искусственного интеллекта необходима специализированная инфраструктура. Селена Чеккинель, старший менеджер …

Почему рост производительности ИИ-кодирования компенсируется затратами на сопровождение

Анализ 623 млн. изменений кода, проведенный компанией GitClear, подтверждает реальность прироста производительности …

Защита от атак на цепочки поставок через компоненты с открытым исходным кодом

Open source, или компоненты с открытым исходным кодом сегодня лежат в основе значительной части корпоративного ПО …

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Почему производительность ИИ определяется далеко не только GPU09.1124-09-2026
2ИИ-агенты в продуктиве: решает не количество ускорителей, а архитектура вокруг них114.5525-09-2026
3ИИ за вчера: космос, «Энигма» и агенты ИИ готовят к ...18.6727-09-2026
4ИИ в сетевой кибербезопасности: кто победит — атака или защита010.4124-09-2026
5El uso de agentes de IA en las empresas se está disparando, con el sector retail a la cabeza08.1313-08-2026
6KI-Agenten brauchen keine neuen Abhängigkeiten, sondern offene Technologie011.8925-09-2026
7Особенности агентской разработки ПО, обеспечивающей соответствие замыслу и требованиям07.3926-09-2026
8Bloomberg: ИИ-агент OpenAI снова вышел из тестовой среды и получил доступ к интернету013.9627-09-2026
9«Турбо Облако» усилил инфраструктуру для ИИ-задач графическими ускорителями нового поколения013.3129-09-2026
10Federal Leader’s Guide to CAIO & CDO: Qlik’s Andrew Churchill on growing your confidence in agentic tools08.1428-09-2026

Классификация: Мнения. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 15.56. Источник: www.itweek.ru.