{"enrichment":{"faq":[{"a":"qianwen-vision processes images and videos through Qwen's vision models to extract text, understand visual content, and reason about complex scenes. You can use it for OCR on receipts and documents, analyze charts and tables, compare multiple images, and extract key information from video frames.","q":"What can qianwen-vision do with images and videos?"},{"a":"Yes. qianwen-vision supports OCR capabilities to extract text from screenshots, documents, receipts, invoices, and tables. It can read and digitize text from image files, making it useful for document scanning and data extraction workflows.","q":"Can I extract text from screenshot using OCR with qianwen-vision?"},{"a":"qianwen-vision can understand video content by analyzing video frames to extract key information and provide comprehension. This enables video frame analysis and summarization, helping you derive insights from video material.","q":"Does qianwen-vision support video analysis?"},{"a":"qianwen-vision performs visual reasoning by solving problems step-by-step from images. It can analyze charts, work through math problems shown in images, and answer visual questions about complex scenes, supporting reasoning-focused workflows.","q":"How does qianwen-vision handle visual reasoning tasks?"},{"a":"Yes. qianwen-vision can compare two or more images side by side and analyze visual differences between them, making it useful for multi-image comparison tasks and identifying changes across related images.","q":"Can qianwen-vision compare multiple images?"},{"a":"qianwen-vision is released under the Apache-2.0 license, allowing broad use and modification while maintaining appropriate attribution requirements.","q":"What license does qianwen-vision use?"}],"shadow_tags":["multimodal-ai","document-processing","text-recognition","visual-qa","video-analysis","chart-reading","object-detection","reasoning-engine","content-extraction"],"summary_rewrite":"qianwen-vision lets you process images and videos through Qwen's vision models to extract text, understand visual content, and reason about complex scenes. Use it for OCR, chart/table analysis, multi-image comparison, and video comprehension across multiple model options tuned for speed, precision, or reasoning depth."},"files":[{"bytes":20177,"path":"skills/vision/qianwen-vision/SKILL.md","sha256":"d3d5ef7285c39ade51b3d9ae372b1f4a4d24351cec6f63e951ac7f2d349749c1","url":"https://skillfed.io/files/QianWen-AI/qianwen-ai/qianwen-vision/3425188a/SKILL.md"}],"id":"QianWen-AI/qianwen-ai/qianwen-vision","links":{"html":"https://skillfed.io/QianWen-AI/qianwen-ai/qianwen-vision","md":"https://skillfed.io/QianWen-AI/qianwen-ai/qianwen-vision.md","repo":"https://github.com/QianWen-AI/qianwen-ai"},"meta":{"agents_supported":[],"first_seen":"2026-07-28","forks":0,"language":"Python","last_updated":"2026-06-17","license":"Apache-2.0","name":"qianwen-vision","publisher":"QianWen-AI","stars":38},"relations":{"categories":["computer-vision","document-processing","ai-multimodal"],"similar":[{"id":"QwenCloud/qwencloud-ai/qwencloud-vision"},{"id":"QianWen-AI/qianwen-ai/qianwen-text"},{"id":"QianWen-AI/qianwen-ai/qianwen-video-generation"},{"id":"QianWen-AI/qianwen-ai/qianwen-audio-tts"},{"id":"QianWen-AI/qianwen-ai/qianwen-image-generation"},{"id":"QianWen-AI/qianwen-ai/qianwen-ops-auth"},{"id":"QianWen-AI/qianwen-ai/qianwen-model-selector"},{"id":"QwenCloud/qwencloud-ai/qwencloud-text"},{"id":"QianWen-AI/qianwen-ai/qianwen-update-check"},{"id":"QianWen-AI/qianwen-ai/qianwen-usage"}]},"slug":{"owner":"QianWen-AI","repo":"qianwen-ai","skill":"qianwen-vision"},"version":"3425188a"}
