Qué hace
Añade comprensión de imágenes a los agentes de programación que solo trabajan con texto. Pegas una imagen y recibes evidencias en JSON estructurado, con el texto por OCR, la maquetación y la semántica, para que el agente trabaje a partir de ellas.
Casos de uso
- 01Leer el texto de una captura de pantalla pegada
- 02Describir la maquetación de un diseño de interfaz
- 03Dar a un agente de texto datos estructurados de una imagen