What it does
An open-source framework for evaluating AI applications such as agents and chatbots. It provides a way to score outputs and produce quality signals, and it is available as a Python package.
Use cases
- 01Score chatbot answers against quality criteria
- 02Compare two versions of an agent
- 03Add output checks to a test routine