Продакшн-інференс: погляд на продуктивність [Партнерська доповідь] [ukr]

Розгортання та оптимізація LLM-інференсу в продакшні на GPU від L4 до 4xH200: вибір інференс-двигунів та конфігурацій, баланс між пропускною здатністю, затримкою та вартістю, а також як «вичавити» максимум із обладнання й уникнути типових помилок тюнінгу

Дмитро Федоренко
AI Director at De Novo
  • Наразі у De Novo побудовано дві хмарні платформи для AI/ML: замовники De Novo користуються LLMs, Speech To Text, CV
  • За допомогою штучного інтелекту Дмитро допомагає компаніям впроваджувати інтелектуальний пошук, аналіз документації, а також корпоративний knowledge management
  • На думку Дмитра, у найближчі роки найбільш потрібними будуть мультимодальні генеративні моделі, персоналізовані генеративні системи, передбачувальна аналітика, контекстне розуміння природної мови
Увійти
Або поштою
Увійти
Або поштою
Реєстрація через e-mail
Реєстрація через e-mail
Забули пароль?