Продакшн-інференс: погляд на продуктивність [ukr]
[доповідь від партнера]
Розгортання та оптимізація LLM-інференсу в продакшні на GPU від L4 до 4xH200: вибір інференс-двигунів та конфігурацій, баланс між пропускною здатністю, затримкою та вартістю, а також як «вичавити» максимум із обладнання й уникнути типових помилок тюнінгу
Дмитро Федоренко
AI Director at De Novo
- Наразі у De Novo побудовано дві хмарні платформи для AI/ML: замовники De Novo користуються LLMs, Speech To Text, CV
- За допомогою штучного інтелекту Дмитро допомагає компаніям впроваджувати інтелектуальний пошук, аналіз документації, а також корпоративний knowledge management
- На думку Дмитра, у найближчі роки найбільш потрібними будуть мультимодальні генеративні моделі, персоналізовані генеративні системи, передбачувальна аналітика, контекстне розуміння природної мови