Evals для тестування агентів [ukr]
Створити AI-агента — лише половина задачі. Треба ще зрозуміти, наскільки добре він працює і чи не став гіршим після зміни моделі, запиту, інструментів або даних. У доповіді на практичному прикладі розберемо, як створювати Evals для AI-агентів: формувати тестові сценарії, визначати критерії та метрики якості, використовувати автоматичні перевірки, LLM-as-a-Judge і ручне оцінювання, порівнювати версії агента та вбудовувати Evals у процес розробки й тестування.
Олександр Краковецький
СЕО at DevRain
- Керівник української ІТ компанії DevRain
- Співзасновник та технічний керівник ДонорUA - інтелектуальної системи рекрутингу донорів крові
- Кандидат технічних наук з інформаційних технологій
- Microsoft Regional Director, Microsoft Artificial Intelligence Most Valuable Professional
- Microsoft Certified: Azure Data Science Associate
- Linkedin , Facebook