LavenderMikey

cv-paper-innovation

Analyze multiple computer-vision research papers and mine concrete, implementable innovation proposals from them. Use when the user shares CV papers, PDFs, paper notes, or paper titles and asks for research ideas, paper topics, innovation points, ways to improve metrics, or a framework that combines modules from object detection, segmentation, tracking, video understanding, restoration, or related CV work. Produce a structured Chinese Markdown report with feasible model changes, experiment design, and novelty checks. Trigger on Chinese requests such as "找创新点", "想个新点子", "怎么改进能涨点", "把这几篇论文结合一下", or "帮我设计一个新模型".

LavenderMikey 1 Updated 2w ago

Resources

6
GitHub

Install

npx skillscat add lavendermikey/cv-paper-innovation-skill

Install via the SkillsCat registry.

SKILL.md

CV 论文创新点挖掘

帮助科研用户从多篇计算机视觉论文中,挖掘可落地、能解决真实问题、改进后有希望提升指标的创新框架,并做 novelty check,避免重复造轮子。

核心判断标准

始终用下面四条标准筛选输出,宁缺毋滥:

  1. 可落地、能实现:提案要具体到模块、接口、训练或推理机制,说明"动哪里、怎么动"。
  2. 解决真实问题:每个创新点必须挂钩到论文中确实存在的局限、失败模式或未解决场景。
  3. 有涨点逻辑:从机制上解释为什么可能提升指标,并给出可验证实验设计。
  4. 尽量不撞车:检查类似 primitive 是否已存在、本子领域是否已被做过,并给差异化建议。

不要输出"引入注意力机制""加入多尺度融合""换更强 backbone"这类空泛建议,除非已经落到具体模块、插入位置和验证方式。

工作流程

1. 确定阅读方案

先统计用户提供的论文数量,再选择读法:

  • 1-4 篇:逐篇精读,重点读 method、experiments、ablation、limitation/conclusion。
  • 5-10 篇:先读摘要、引言、方法概述和关键图表,筛出最相关的 3-5 篇精读。
  • 10 篇以上:先按任务、数据集、模块可迁移性快筛,挑 4-6 篇作为核心子集,其余仅作背景。

报告开头简短说明采用的阅读范围:哪些精读、哪些略读、为什么这样筛。

2. 加载领域参考

识别论文所属 CV 子方向后,只按需读取相关参考文件。不要一次性加载全部 reference。

  • 目标检测:读取 references/detection.md
  • 图像/实例/全景/视频分割:读取 references/segmentation.md
  • 单目标/多目标/视觉语言跟踪:读取 references/tracking.md
  • 通用 backbone、训练技巧、迁移模块、评估原则:通常搭配读取 references/common.md

如果方向跨多个子领域,可以读取多份,但要在报告中说明主要评估口径。

3. 逐篇解析

对精读论文提取:

  • 核心任务:解决什么 CV 问题。
  • 关键方法:整体 pipeline 和关键模块。
  • 创新点:1-3 条,必须具体到模块或机制。
  • 报告指标:数据集、指标、数值、训练设置;无法确认时标注需核实。
  • 仍存在的问题:具体、可改进的局限,例如小目标、遮挡、长时漂移、密集场景、跨域、实时性、标注成本、边界质量等。

优先使用论文作者自己承认的 limitation,再补充机制层面的判断。

4. 搜索近期相关工作

如果用户明确要求最新工作、novelty check、撞车检查,或任务高风险地依赖最新论文,必须联网检索。若当前环境不能联网,应明确说明,并将具体论文引用标注为"需人工核实"。

搜索时分两类查:

  • 通用 primitive:该机制是否已在其他 CV 方向或机器学习领域出现。
  • 本子领域应用:该机制是否已经被用于当前任务、数据集或 baseline。

记录最接近的 1-3 个工作:标题、年份/会议、链接、相似点、差异点。不要编造论文、作者、数值或链接。

5. 形成完整新模型

核心产出不是模块清单,而是一个能直接开工的方案:

  • Baseline:从论文中选一个强且适合改的底座,说明选择理由。
  • 2-3 条具体改动:每条说明改哪个模块、输入输出如何对齐、训练/推理如何接入。
  • 至少一条原创核心改动:不是单纯搬运模块,而是基于论文观察提炼出的组合、约束或机制变化。
  • 协同逻辑:改动之间要能讲成一个整体故事,而不是彼此无关的拼盘。
  • 涨点锚点:对应 baseline 的原始指标、数据集或失败属性,说明预期提升来源。
  • 实验设计:baseline、数据集、指标、消融、成本统计、失败案例分析。

写到一个该方向研究生能照着实现的粒度。若描述无法转成代码或实验,就继续具体化。

6. 做撞车检查

对每条核心改动评估新颖性:

  • 分别判断"底层 primitive 是否已有"和"本子领域是否已有"。
  • 给出风险等级:高 / 中 / 低。
  • 说明最接近工作的相似点与关键差异。
  • 给出差异化建议,例如换应用场景、增加约束、改变训练信号、强调效率或鲁棒性。

未联网时,不要下绝对结论;写成"基于已有知识的初步判断,需联网/人工核实"。

7. 输出推荐程度

不要把所有想法平铺。用推荐程度排序:

  • 强推:最可落地、风险较低、实验路径清晰。
  • 谨慎:有潜力但撞车、工程量或数据风险较高。
  • 不建议优先做:方向过挤、难验证、成本过高或创新点不够硬。

默认报告结构

除非用户要求完整逐篇解析,默认输出精简报告:

## 阅读范围
[精读/略读说明]

## 推荐模型:[名字](暂名)
**Baseline:** [方法名 + 选择理由]

**核心改动**
1. [原创核心改动]:[动哪里、怎么动、接口如何对齐、依据哪篇论文的哪个观察]
2. [迁移/协同改动]:[从哪里迁移、如何接入、为什么配合 1]
3. [可选小改]:[训练、损失、推理或轻量化改动]

**为什么可能涨点:** [对应失败模式 + 机制解释 + 指标锚点]

**实验设计:**
- Baseline:
- 数据集 / 指标:
- 消融:
- 成本统计:

## 撞车检查
| 改动 | 风险 | 最接近工作 | 差异化建议 |
| --- | --- | --- | --- |

## 推荐程度
| 程度 | 方向 | 理由 |
| --- | --- | --- |

只有当用户明确要求"完整逐篇解析"时,才额外加入逐篇论文表格。

常见失败模式

  • 不要杜撰文献、作者、年份、指标或链接。
  • 不要声称能提升固定点数,除非用户提供了实验或可靠来源。
  • 不要用不可比设置做涨点判断;提醒用户同 backbone、同分辨率、同训练数据/轮次下比较。
  • 不要只输出模块名;必须写清插入位置、接口、训练目标和消融。
  • 不要忽略工程成本;涉及实时、移动端、边缘部署时必须报告参数量、FLOPs、FPS/延迟。