Дизайн набора тестов для LLM-функции
Практический разбор темы «дизайн набора тестов для llm-функции»: как создать сценарии, ошибки и эталонные ожидания для регулярной оценки и применить это в рабочем продукте.
Тег · 8 материалов
Материалы из разных направлений, связанные одной рабочей практикой.
Практический разбор темы «дизайн набора тестов для llm-функции»: как создать сценарии, ошибки и эталонные ожидания для регулярной оценки и применить это в рабочем продукте.
Практический разбор темы «инструменты и function calling в llm-приложениях»: как описывать функции, проверять аргументы и безопасно исполнять вызовы и применить это в рабочем продукте.
Многоуровневая защита LLM-приложений от прямых и косвенных prompt injection: доверительные границы, инструменты, данные и контроль действий.
Практический разбор темы «как оценивать rag до промышленного запуска»: как проверить поиск, контекст, обоснованность ответа и пригодность к рабочему сценарию и применить это в рабочем продукте.
Практический разбор темы «как писать системные инструкции для llm»: как задавать роль, ограничения, формат и приоритеты без противоречивых требований и применить это в рабочем продукте.
Практический разбор темы «как управлять длиной и составом контекста llm»: как отбирать релевантные данные, исключать шум и сохранять ключевые зависимости и применить это в рабочем продукте.
Практический разбор темы «оценка стабильности ответов при повторных запусках»: как измерять вариативность и определять допустимый диапазон результата и применить это в рабочем продукте.
Классификация недостоверных генераций LLM и практический выбор метрик для фактических ошибок, противоречий контексту и вымышленных ссылок.