Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
The table of contents is too big for display.
Diff view
Diff view
  •  
  •  
  •  
The diff you're trying to view is too large. We only load the first 3000 changed files.
14 changes: 14 additions & 0 deletions data/provenance/PAPER_NOTES_UPSTREAM.md
Original file line number Diff line number Diff line change
@@ -0,0 +1,14 @@
# Paper-Notes docs provenance

- upstream_repository: https://github.com/zhaoyang97/Paper-Notes.git
- upstream_branch: main
- upstream_commit: 2a378054bdca25df4b5418e9cd64b02fc6aa789e
- synced_at_utc: 2026-07-30T12:32:02Z
- mirrored_scope: conference-year directories from upstream docs/
- managed_directory_manifest: data/provenance/PAPER_NOTES_UPSTREAM_DIRS.txt
- protected_local_paths: docs/index.md, docs/search.md, docs/notes/, docs/assets/, docs/javascripts/, docs/stylesheets/, docs/review-routing.md
- license_copy: third_party/Paper-Notes/LICENSE

The synchronized conference notes originate from zhaoyang97/Paper-Notes.
Local AAMAS notes and the adapted AAMAS front end are deliberately excluded
from synchronization. Retain the upstream license and attribution.
12 changes: 12 additions & 0 deletions data/provenance/PAPER_NOTES_UPSTREAM_DIRS.txt
Original file line number Diff line number Diff line change
@@ -0,0 +1,12 @@
AAAI2026
ACL2025
ACL2026
CVPR2025
CVPR2026
ECCV2024
ECCV2026
ICCV2025
ICLR2026
ICML2025
ICML2026
NeurIPS2025
1,448 changes: 1,448 additions & 0 deletions docs/AAAI2026/.gitignore

Large diffs are not rendered by default.

Original file line number Diff line number Diff line change
@@ -0,0 +1,116 @@
---
title: >-
[论文解读] 3D-ANC: Adaptive Neural Collapse for Robust 3D Point Cloud Recognition
description: >-
[AAAI 2026][3D视觉][点云识别] 将Neural Collapse(NC)机制引入3D点云对抗鲁棒性,用固定的ETF分类头+自适应训练框架(RBL+FDL)构建解耦的特征空间,在ModelNet40上将DGCNN的对抗准确率从27.2%提升到80.9%,超出最佳baseline 34个点。
tags:
- "AAAI 2026"
- "3D视觉"
- "点云识别"
- "对抗鲁棒性"
- "Neural Collapse"
- "ETF分类器"
- "特征解耦"
---

# 3D-ANC: Adaptive Neural Collapse for Robust 3D Point Cloud Recognition

**会议**: AAAI 2026
**arXiv**: [2511.07040](https://arxiv.org/abs/2511.07040)
**代码**: 暂无
**领域**: 3D视觉 / 对抗鲁棒性
**关键词**: 点云识别, 对抗鲁棒性, Neural Collapse, ETF分类器, 特征解耦

## 一句话总结
将Neural Collapse(NC)机制引入3D点云对抗鲁棒性,用固定的ETF分类头+自适应训练框架(RBL+FDL)构建解耦的特征空间,在ModelNet40上将DGCNN的对抗准确率从27.2%提升到80.9%,超出最佳baseline 34个点。

## 背景与动机
3D点云识别模型(PointNet、DGCNN、PCT等)在对抗攻击面前非常脆弱。现有防御方法分两类:输入预处理(SOR、DUP-Net、Diffusion)和自鲁棒模型(对抗训练、PointCutMix、CAP),但都有致命缺陷——泛化性差,面对没见过的攻击类型时防御效果急剧下降。作者通过t-SNE可视化发现了根本原因:无论是原始模型还是现有防御方法,提取的特征空间都是纠缠(entangled)的,不同类别特征高度重叠,对抗样本很容易被扰动到其他类的决策边界。

## 核心问题
如何让点云模型拥有天然解耦的特征空间,使得对抗扰动难以跨越类间决策边界?难点在于点云数据的两个独特特性:(1)类别不平衡——ModelNet40中chair有900个样本,bowl只有不到90个;(2)类间几何相似性——desk和table、nightstand和dresser等类别几何外观极其相似,即使人类也难以区分。

## 方法详解
核心思路:利用Neural Collapse现象——训练后期模型最后一层特征和分类器权重会收敛到simplex ETF(等角紧框架)结构,即各类特征方向两两夹角最大化分离。3D-ANC不等模型自然收敛到NC,而是直接用固定的ETF结构初始化分类头,迫使特征提取器学出解耦特征。

### 整体框架
输入:3D点云 → 任意现有backbone(PointNet/DGCNN/PCT)提取特征h → 替换原分类头为固定ETF分类头 → 用自适应训练框架(RBL+FDL)优化 → 输出:对抗鲁棒的分类结果。模型无关(model-agnostic),只需替换分类头。

### 关键设计
1. **ETF分类头**: 用随机初始化的simplex ETF矩阵W替换可学习的FC分类头。ETF保证K个类的分类向量两两夹角相等且最大化分离(cos θ = -1/(K-1))。W在训练中固定,迫使特征提取器学出与各类分类向量对齐的特征。用dot loss(公式3)约束特征h与对应类分类向量w_k的内积趋近预定值。
2. **Representation-Balanced Learning (RBL)**: 解决类别不平衡问题。固定ETF头的方向由旋转矩阵R决定,RBL允许R在训练中更新(但约束为正交矩阵,保持ETF性质),使ETF头能自适应不平衡数据分布。效果:在clean样本上恢复了固定ETF头带来的精度下降(+3.7%)。
3. **Dynamic Feature Direction Loss (FDL)**: 解决类间几何相似性。对每个样本特征h,FDL同时做两件事:(a) 拉向——让h对齐自身类别均值h̄_k;(b) 推离——让h远离最近的非标签类均值h̄_k'。类间均值逐epoch动态更新。效果:针对几何相似类(如desk/table)增强类间可分性。但FDL依赖准确的类均值,需要RBL提供良好对齐的特征后才能发挥作用。

### 损失函数 / 训练策略
- 总损失: L = L_dot(h, W) + λ · L_FDL(h, h̄_k, h̄_k')
- 两阶段训练:先用L_dot做10个warm-up epochs,再加入L_FDL。λ=5
- 总训练60 epochs,lr=0.001,用geotorch库约束R为正交矩阵
- 推理时加SOR预处理(k=2, α=1.1)去除离群点

## 实验关键数据

| 模型 | 数据集 | 防御方法 | 平均对抗ACC | Clean ACC |
|------|--------|---------|-----------|----------|
| PointNet | ModelNet40 | Vanilla | 39.5% | 86.2% |
| PointNet | ModelNet40 | 最佳baseline(Diffusion) | 47.9% | - |
| PointNet | ModelNet40 | **3D-ANC** | **78.8%** | 87.1% |
| DGCNN | ModelNet40 | Vanilla | 27.2% | 88.9% |
| DGCNN | ModelNet40 | 最佳baseline(Diffusion) | 46.9% | - |
| DGCNN | ModelNet40 | **3D-ANC** | **80.9%** | 90.9% |
| PCT | ModelNet40 | Vanilla | 47.5% | 89.6% |
| PCT | ModelNet40 | **3D-ANC** | **77.3%** | 91.0% |

推理效率:3D-ANC几乎无额外开销(PointNet: 0.2ms vs Vanilla 0.3ms),远优于Diffusion(4.4ms)。

### 消融实验要点
- **ETF头是最大贡献者**: 仅加ETF头,PointNet平均对抗ACC从39.5%提升到77.6%(+38.1pp),但clean ACC掉0.6%
- **RBL恢复clean性能**: ETF+RBL在clean ACC上+3.7%(从85.6%到89.9%),但对抗鲁棒性略降(因为引入旋转的不稳定性)
- **FDL需要RBL配合**: 单独ETF+FDL效果不如ETF+RBL(因为没有准确的特征对齐);但ETF+RBL+FDL组合达到最优(平均对抗ACC 78.8%),FDL在RBL提供的良好特征基础上进一步增强类间分离
- **架构越强,FDL效果越好**: DGCNN和PCT的特征空间更结构化,FDL能同时提升clean ACC和鲁棒性
- **特征质量与鲁棒性强相关**: Silhouette Coefficient(SC)越高,对抗ACC越高,3D-ANC显著提升了SC

## 亮点 / 我学到了什么
- **思路极其简洁有效** — "替换分类头"这个操作几乎零成本,却带来了53.7%的绝对提升,说明特征空间质量才是对抗鲁棒性的根本
- **NC→鲁棒性的桥梁很有启发**: Neural Collapse本来是训练收敛现象的理论描述,这篇论文把它变成了一个实用的设计工具。不等模型自然收敛到NC,而是主动构造NC结构
- **"特征空间解耦=鲁棒性"的洞察**: 通过t-SNE可视化清晰地说明了现有防御失败的根因——特征纠缠,这个可视化分析本身就是很好的论文写作套路
- **模型无关(model-agnostic)**: 只改分类头,可即插即用到任何点云backbone,实用性强
- **两阶段训练+组件协作设计**: RBL解决不平衡→FDL在此基础上精细化类间分离,组件之间有逻辑依赖关系,不是简单堆砌

## 局限与展望
- **仅在分类任务上验证**: 未测试在点云分割、检测等任务上的效果
- **仅限点云模态**: NC思路完全可以推广到2D图像、多模态等领域的对抗鲁棒性
- **ShapeNet上clean ACC有下降**: 在ShapeNet数据集上PointNet的clean ACC从78.6%降到74.1%,说明在某些数据分布上ETF头可能有负面影响
- **几何相似类仍未完全解决**: 从可视化看desk/table、nightstand/dresser等类别仍然部分重叠
- **未与更强的对抗训练方法(如PGD-AT的变体)结合对比**
- → 可关联到将NC机制推广到视觉foundation model的鲁棒性增强

## 与相关工作的对比
- **vs 输入预处理(SOR/DUP-Net/PointDP)**: 预处理方法针对特定攻击模式(如去除离群点),对未见过的攻击泛化性差。3D-ANC从特征空间根本上提升鲁棒性,泛化到9种不同攻击。且3D-ANC可与预处理方法叠加使用
- **vs 对抗训练(AT)/自鲁棒模型(PointCutMix/CAP)**: 这些方法通过数据增强或自监督来增强鲁棒性,但特征空间仍然纠缠。3D-ANC直接从分类头结构入手,特征解耦更彻底。AT在AdvPC攻击下ACC仅2.5%,而3D-ANC为81.3%
- **vs Neural Collapse在图像分类中的应用(Yang2022/Zhong2023)**: 之前的NC工作主要解决长尾分类中的类别不平衡,没有用于对抗鲁棒性。3D-ANC首次将NC用于对抗鲁棒性,并针对点云数据的特殊挑战(类别不平衡+几何相似性)设计了RBL和FDL

## 与我的研究方向的关联
- Neural Collapse作为"设计工具"而非"待观察现象"的思路很有启发,可以迁移到视觉foundation model的特征空间优化
- 特征解耦→鲁棒性的逻辑链条也适用于医学图像等domain shift场景

## 评分
- 新颖性: ⭐⭐⭐⭐ 首次将NC用于点云对抗鲁棒性,思路清晰且有效,但各组件(ETF头、方向loss)单独看不算新
- 实验充分度: ⭐⭐⭐⭐⭐ 3个模型×2个数据集×9种攻击×7种baseline防御,消融细致,含效率分析和可视化
- 写作质量: ⭐⭐⭐⭐ pilot study的motivating分析很有说服力,方法描述清晰,附录详尽
- 对我的价值: ⭐⭐⭐ NC作为设计工具的思路可借鉴,但点云对抗鲁棒性不是我的核心方向

<!-- RELATED:START -->

<div class="related-papers" markdown="1">

## 相关论文

- [\[AAAI 2026\] DAPointMamba: Domain Adaptive Point Mamba for Point Cloud Completion](dapointmamba_domain_adaptive_point_mamba_for_point_cloud_completion.md)
- [\[AAAI 2026\] Point Cloud Quantization through Multimodal Prompting for 3D Understanding](point_cloud_quantization_through_multimodal_prompting_for_3d_understanding.md)
- [\[AAAI 2026\] Multi-Modal Assistance for Unsupervised Domain Adaptation on Point Cloud 3D Object Detection](multi-modal_assistance_for_unsupervised_domain_adaptation_on_point_cloud_3d_obje.md)
- [\[CVPR 2025\] Toward Robust Neural Reconstruction from Sparse Point Sets](../../CVPR2025/3d_vision/toward_robust_neural_reconstruction_from_sparse_point_sets.md)
- [\[AAAI 2026\] Rethinking Multimodal Point Cloud Completion: A Completion-by-Correction Perspective](rethinking_multimodal_point_cloud_completion_a_completion-by-correction_perspect.md)

</div>

<!-- RELATED:END -->
Original file line number Diff line number Diff line change
@@ -0,0 +1,151 @@
---
title: >-
[论文解读] 3D-Free Meets 3D Priors: Novel View Synthesis from a Single Image with Pretrained Diffusion Guidance
description: >-
[AAAI 2026][3D视觉][新视角合成] 提出将 3D-free 方法(HawkI 风格的 test-time optimization)与 3D-based 先验(Zero123++ 的弱引导图)结合的框架,无需额外 3D 数据或训练即可从单张图片生成指定仰角/方位角的相机控制视图,在复杂场景下 LPIPS、CLIP-Score 等指标全面超越 Zero123++、HawkI 和 Stable Zero123。
tags:
- "AAAI 2026"
- "3D视觉"
- "新视角合成"
- "单图生成"
- "扩散模型"
- "CLIP"
- "Zero123++"
- "3D-free"
- "相机控制"
- "LoRA"
---

# 3D-Free Meets 3D Priors: Novel View Synthesis from a Single Image with Pretrained Diffusion Guidance

**会议**: AAAI 2026
**arXiv**: [2408.06157](https://arxiv.org/abs/2408.06157)
**代码**: 待确认
**领域**: 3D Vision / 新视角合成
**关键词**: 新视角合成, 单图生成, Stable Diffusion, CLIP, Zero123++, 3D-free, 相机控制, LoRA

## 一句话总结

提出将 3D-free 方法(HawkI 风格的 test-time optimization)与 3D-based 先验(Zero123++ 的弱引导图)结合的框架,无需额外 3D 数据或训练即可从单张图片生成指定仰角/方位角的相机控制视图,在复杂场景下 LPIPS、CLIP-Score 等指标全面超越 Zero123++、HawkI 和 Stable Zero123。

## 背景与动机

单图新视角合成(NVS)是 3D 视觉中的核心任务。现有方法分为两大流派:

1. **3D-based 方法**(如 Zero123、Zero123++):在大规模 3D 数据集(Objaverse,80 万物体)上训练扩散模型,支持精确相机角度控制,但以物体为中心,对复杂场景(多物体+背景)泛化差
2. **3D-free 方法**(如 HawkI、DreamBooth):利用预训练 Stable Diffusion 的隐式 3D 知识,无需 3D 数据即可生成文本控制的视角变换,对复杂场景泛化好,但缺乏精确的相机角度控制

关键洞察:CLIP 模型(SD 的视觉-语言骨干)理解"上方/侧面"等粗粒度方向,但无法理解"仰角 30°"等精确角度信息——这是 3D-free 方法缺乏相机控制的根本原因。

## 核心问题

如何在不使用 3D 数据集和额外训练的前提下,结合 3D-free 方法的场景泛化能力和 3D-based 方法的相机控制能力,实现单图精确相机控制的新视角合成?

## 方法详解

### 整体框架

四步 test-time optimization 流程:利用预训练 Zero123++ 生成弱引导图,在 Stable Diffusion 的 CLIP 嵌入空间中注入 3D 角度信息,通过 LoRA 微调和正则化损失实现精确相机控制。

### 关键设计

1. **弱引导图生成**:用预训练 Zero123++ 从输入图 $I_{input}$ 生成目标角度 $(\alpha_{elev}, \alpha_{azi})$ 的预测图 $I_{view}$。该预测质量不高(尤其在复杂场景下),但提供方向性指导。

2. **四步 Test-time Optimization**:

- **Step 1**:优化 CLIP 文本嵌入 $e_{optim}$,使其最准确重建 $I_{input}$(1000 次迭代,lr=1e-3)
- **Step 2**:在 $e_{optim}$ 处微调 UNet 的 LoRA 层以重建 $I_{input}$(500 次迭代,lr=2e-4)
- **Step 3**:进一步优化嵌入为 $e_{view}$ 以重建弱引导图 $I_{view}$(500 次迭代)
- **Step 4**:微调 LoRA 层重建 $I_{view}$,同时加入视角正则化损失(250 次迭代)

3. **视角正则化损失**(核心贡献):
$L_{reg} = \|e_{view} - e_{target}\|^2$
其中 $e_{target}$ 是包含目标仰角/方位角信息的文本嵌入(如"View from +30 degrees elevation")。该正则化在 CLIP 空间中注入 3D 角度知识,弥补 CLIP 对精确角度理解的不足。

4. **互信息引导推理**:生成阶段使用目标文本描述(角度+场景描述),并施加互信息引导确保生成内容与输入图像一致。

### 损失函数

- 重建损失:标准 DDPM 去噪损失 $L(f(x_t, t, e; \theta), I)$
- 视角正则化:$L_{reg} = \|e_{view} - e_{target}\|^2$
- 总损失(Step 4):$L_{total} = L_{recon} + L_{reg}$

## 实验关键数据

### HawkI-Syn 数据集(合成场景)

| 方法 | 角度 | LPIPS↓ | CLIP-Score↑ | DINO↑ | CLIP-I↑ |
|------|------|--------|------------|-------|---------|
| **Ours** | (30°,30°) | **0.5661** | **29.96** | **0.4314** | **0.8317** |
| Zero123++ | (30°,30°) | 0.5694 | 28.26 | 0.4293 | 0.8149 |
| HawkI | (30°,30°) | 0.5998 | 28.38 | 0.3982 | 0.8221 |
| Stable Zero123 | (30°,30°) | 0.7178 | 21.34 | 0.2108 | 0.6467 |
| **Ours** | (30°,270°) | **0.5744** | **29.18** | **0.4148** | **0.8327** |
| Zero123++ | (30°,270°) | 0.6056 | 25.67 | 0.2681 | 0.7087 |

### HawkI-Real 数据集(真实场景)

| 方法 | LPIPS↓ | CLIP-Score↑ | CLIP-I↑ |
|------|--------|------------|---------|
| **Ours** | **0.6201** | **29.89** | **0.8152** |
| Zero123++ | 0.6529+ | 27.58- | 0.7754 |
| HawkI | 0.6529 | 27.58 | 0.7754 |

- LPIPS 最大改进 0.1712(对比 HawkI-Syn (-20°,210°)),是 Zero123++ 论文中报告的最大差距的 5.2 倍

### 消融实验

- 去掉视角正则化损失 → 相机角度控制退化,生成视角不一致
- 去掉弱引导图(只用文本角度描述)→ CLIP 无法独立生成正确相机角度,内容不一致
- 使用错误角度的引导图 → 模型跟随引导图角度而非文本描述角度,证明引导图的角度信息主导方向

## 亮点

- **"3D-free + 3D prior"的融合思路简洁有效**:不需要训练新模型,只需在 test-time 通过 4 步优化把 3D 先验注入 2D 扩散模型
- **对 CLIP 3D 理解能力的分析有价值**:证明 CLIP 理解粗粒度方向但不理解精确角度,为后续工作提供理论依据
- **数据高效**:完全不需要 3D 数据集、多视图数据或额外训练,只用现成的预训练模型
- **复杂场景处理出色**:包含背景、多物体的真实场景中显著优于 Zero123++

## 局限与展望

- **推理极慢**:每张图需要 4 步优化(总计约 2250 次迭代),远不如 Zero123++ 的单次前向推理
- **依赖 SD 2.1 + Zero123++**:如果 Zero123++ 在某些场景完全失效,弱引导图质量太差可能影响最终结果
- **评估场景有限**:仅在 HawkI-Syn 和 HawkI-Real 两个小数据集上评估,未在标准 3D 基准(如 GSO、Objaverse-LVIS)上对比
- **角度范围有限**:仅评估了 4 个固定角度组合,大角度变化(如 180° 翻转)的效果未验证
- **分辨率限制**:512×512 分辨率,未探索高分辨率生成

## 与相关工作的对比

- **vs Zero123++(3D-based)**:Zero123++ 在复杂场景中丢失背景和细节,本方法通过 3D-free 优化保留完整场景;但 Zero123++ 推理速度快得多
- **vs HawkI(3D-free)**:HawkI 无法控制精确角度,本方法通过 3D prior 引导 + 视角正则化实现角度控制
- **vs Stable Zero123**:在所有指标上大幅落后,几乎无法工作
- **vs DreamFusion**:DreamFusion 是 Text-to-3D 方法,不能处理背景变换和仰角变化

## 启发与关联

- "用弱引导 + 正则化"注入缺失能力的方法论可推广——任何预训练模型缺少某种控制能力时,都可以用类似方式注入
- CLIP 对 3D 空间理解的分析可为 VLM 的 3D grounding 研究提供参考
- Test-time optimization 虽慢但灵活——当质量比速度更重要时值得考虑

## 评分

- 新颖性: ⭐⭐⭐⭐ 融合思路直觉但不算突破性,各组件都是现有方法
- 实验充分度: ⭐⭐⭐⭐ 评估场景偏少,缺少标准 3D 基准对比
- 写作质量: ⭐⭐⭐⭐⭐ 分析部分(CLIP 3D 理解、引导图重要性)论证清晰
- 价值: ⭐⭐⭐⭐ 提供了一种不需要 3D 数据的相机控制方案,但推理速度限制实用性

<!-- RELATED:START -->

<div class="related-papers" markdown="1">

## 相关论文

- [\[CVPR 2026\] SmokeSVD: Smoke Reconstruction from A Single View via Progressive Novel View Synthesis and Refinement with Diffusion Models](../../CVPR2026/3d_vision/smokesvd_smoke_reconstruction_from_a_single_view_via_progressive_novel_view_synt.md)
- [\[CVPR 2026\] PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis](../../CVPR2026/3d_vision/pr-iqa_partial-reference_image_quality_assessment_for_diffusion-based_novel_view.md)
- [\[CVPR 2026\] OrienPose: Orientation-Guided Novel View Synthesis for Single-Image Unseen Object Pose Estimation](../../CVPR2026/3d_vision/orienpose_orientation-guided_novel_view_synthesis_for_single-image_unseen_object.md)
- [\[AAAI 2026\] Debiasing Diffusion Priors via 3D Attention for Consistent Gaussian Splatting](debiasing_diffusion_priors_via_3d_attention_for_consistent_gaussian_splatting.md)
- [\[CVPR 2026\] DMAligner: Enhancing Image Alignment via Diffusion Model Based View Synthesis](../../CVPR2026/3d_vision/dmaligner_enhancing_image_alignment_via_diffusion_model_based_view_synthesis.md)

</div>

<!-- RELATED:END -->
Loading