Evals для тестування агентів [ukr]

Створити AI-агента — лише половина задачі. Треба ще зрозуміти, наскільки добре він працює і чи не став гіршим після зміни моделі, запиту, інструментів або даних. У доповіді на практичному прикладі розберемо, як створювати Evals для AI-агентів: формувати тестові сценарії, визначати критерії та метрики якості, використовувати автоматичні перевірки, LLM-as-a-Judge і ручне оцінювання, порівнювати версії агента та вбудовувати Evals у процес розробки й тестування.

Олександр Краковецький
СЕО at DevRain
  • Керівник української ІТ компанії DevRain
  • Співзасновник та технічний керівник ДонорUA - інтелектуальної системи рекрутингу донорів крові
  • Кандидат технічних наук з інформаційних технологій
  • Microsoft Regional Director, Microsoft Artificial Intelligence Most Valuable Professional
  • Microsoft Certified: Azure Data Science Associate
  • Linkedin , Facebook
Увійти
Або поштою
Увійти
Або поштою
Реєстрація через e-mail
Реєстрація через e-mail
Забули пароль?