multimodal-recognition
by Grealin
当用户需要图片识别、剪切板识别、剪贴板图片,或描述/提取图片、音频、视频中的文字信息时使用此 Skill。触发条件包括:用户提到 "图片识别"、"剪切板识别"、"剪贴板图片"、"识别图片"、"描述这张图片"、"图片里有什么"、"识别这个截图"、"识别这张图"、"提取图中的文字"、"剪贴板里有什么"、"转写这段音频"、"这个视频讲了什么"、"分析这张图表"、"听听这个录音说了什么"、"看看这个视频" 等,或直接提供了 .jpg / .jpeg / .png / .webp / .gif / .bmp / .tif / .heic / .wav / .mp3 / .aac / .ogg / .flac / .m4a / .mp4 / .avi / .mkv / .mov 等媒体文件路径,或提供了图片/音频/视频的网络 URL,或提供了 data:image/...;base64,... 格式的剪贴板内容。不要对普通文本文件读取或文档处理使用此 Skill(应使用 pdf/docx/xlsx 等对应 Skill)。