За последние полтора года ИИ-функциональность перестала быть экспериментом и приехала в обычные продакшен-задачи. Ассистент в поддержке, генерация описаний товаров, разбор входящих обращений, подсказки оператору, поиск по базе знаний с ответом человеческим языком. К тестировщику такая задача приходит как любая другая: тикет, макет, срок.
И на ней ломается весь процесс.
Вся тестовая документация в мире построена вокруг фразы «ожидаемый результат». У языковой модели ожидаемого результата в привычном смысле нет. Один и тот же запрос два раза подряд даёт два разных ответа, и оба могут быть корректными. Или оба некорректными.
Разбираем, что конкретно нужно поменять в работе QA, чтобы такие фичи можно было тестировать нормальными инженерными методами: с тест-планом, регрессом, критериями релиза и отчётом, который можно показать заказчику.





















