Qué hace
Un kit de visión que permite a los agentes de DeepSeek Harness que solo manejan texto trabajar con imágenes. Incluye preguntas y respuestas sobre imágenes, OCR de capturas largas, reconstrucción de interfaces a partir de una captura, grounding, diferencias de píxeles, artefactos y una interfaz web.
Casos de uso
- 01Preguntar sobre varias imágenes pegadas
- 02Convertir una captura en código de interfaz
- 03Comparar dos capturas y ver diferencias de píxeles