10 个月从零跑通论文全链路:第一篇 Pattern Recognition(一区)返修等二审,第二篇创新点已成形——进入连续产出节奏。
- PR 返修二审中(一般较快)
- 第二篇创新点实验启动(一对多辅助分支 + FFN 轻量模块)
- 注意力分布统计进行中
- DN 方向去留未决——底层设计修正后整体反而不如 baseline
- 第二篇创新点属 DETR 系已知技术路线,须做出差异化 + 扎实对比,否则审稿风险高
- PR 二审结果未定,需要备好快速调整的 Plan B
- 按类别切分统计高低分分布,验证长尾假设
- 第二篇(一对多辅助分支)实验落地
- 细粒度评价指标方案(三人共同任务,暂无回执)
朱老师评价与指导要点
按时间序 · 远程组会指导记录
- 04:点出 DETR anchor 先验路径(GT 分布→K-means→聚类中心初始化),定位/描述 query 分离方向由其给出
- 06:论文保底策略——三点成主干、勿因局部未解决而频繁换方向、写作禁从结果倒推
- 07:『今天一定要把论文提交上去,已经做了那么多工作』——先写出来先投出,不投即 0
- 09:密集描述领域没人用 DN,没效果不必硬走;目标管理『把我当 AI agent 用』(量化目标+死线)
- 09:长尾假设——低频类别掉点,是不是拟合/学习本身没学到特征
关键节点
绿 = 有效 · 蓝 = 论文 · 红 = 证伪 · 紫 = 指导
2026-03 ~ 04探索起步,收敛主线
毫米波雷达距离修正有效(ATE 显著降)、速度优化多线试错后,收敛回视频描述主线。
2026-04query 拆分确立主线有效
GT 直接放入初始化提升大;定位/描述 query 拆分后 recall 提升——此后 6 个月围绕 query 机制持续深挖。
2026-05CG 概念引导器有效有效
PDVC 上 +1 点、两个数据集均有效(同期 CTC 对齐证伪无效)。
2026-06DN 实验与保底策略
DN 训练+验证都操作时明显提升,但准确率↑召回率显著↓(证伪线);确定论文保底三主干:分类损失 + 解耦架构 + 辅助损失。
2026-07三工作整合成文投出论文
分类损失 + 结构损失合用优于单独使用;定位质量分类损失 Recall 24.2→27.8、Precision +1~2。
2026-09PR 返修提交、等二审论文
一审两小修一大修(补参数量对比/空域调制实验/换数据集),修订已提交。
2026-09低分归因 + 第二篇成形
逐个分析最好/最差各 20 视频:低分集中在训练集低频「模板话术」类别(与句长/时长无关);第二篇创新点针对 DETR 一对一匹配正样本过少。
结果盘点
绿 = 确认有效 · 红 = 证伪排除(同样有价值)
✓ 确认有效
- location/caption query 拆分:recall 提升
- CG 概念引导器:+1 点(双数据集)
- 定位质量分类损失:Recall +3.6 / Precision +1~2
- 分类损失 + 结构损失合用优于单独使用
✕ 证伪排除
- CTC 对齐无提升
- DDVC 核心机制判无效
- DN 机制精度-召回失衡
- 概念区分性权重无提升
袁康研究生视频密集描述(Dense Captioning)
PR 一区·等二审CG 引导器 +1 点Recall +3.6
本站内容整理自组会记录(2025-11 ~ 2026-09),发布前已脱敏:个人去向与单位信息、个人事务、联系方式均已去除,仅保留学习与科研进展。