Skip to content

điểm bảo vệ k đủ tin cậy #13

Description

@VoDaiLocz

Mô tả vấn đề
Kho lưu trữ sử dụng "Điểm bảo vệ" bắt nguồn từ phong cách và sự tương đồng nhúng làm số liệu chính để đánh giá hiệu quả chống bắt chước. Đây là một thước đo đại diện, không phải là thước đo thực tế về việc ngăn chặn bắt chước phong cách thực tế. Điểm số có thể cao trong khi khả năng bảo vệ vẫn có thể không hiệu quả trước các cuộc tấn công bắt chước trong thế giới thực.

Điểm chuẩn có gì sai
Thực hiện hiện tại (từ):/src/auralock/core/metrics.py:308-311

protection_score = 100.0 * (
0.65 * (1.0 - robust_style_similarity)
+ 0.35 * (1.0 - robust_embedding_similarity)
)
Các vấn đề quan trọng:

Chỉ định trọng số tùy ý: Sự phân chia 0,65 / 0,35 giữa kiểu và sự tương đồng nhúng không có lý do thực nghiệm. Tại sao không phải 0,5 / 0,5? Hay 0,8 / 0,2? Các trọng số này không được xác nhận dựa trên kết quả bắt chước thực tế.

Trình trích xuất tính năng đơn: Chỉ sử dụng ResNet18 với trọng số ImageNet (). Các mô hình bắt chước trong thế giới thực (DreamBooth, LoRA) sử dụng các kiến trúc hoàn toàn khác nhau (CLIP, VAE, U-Net). Không gian tính năng không khớp có nghĩa là:/src/auralock/core/style.py:107

Điểm bảo vệ cao ≠ bảo vệ thực tế chống lại các mô hình bắt chước
Số liệu đo lường "trôi dạt trong không gian ResNet18" chứ không phải "ngăn chặn chuyển kiểu"
Không hiệu chuẩn chống lại sự bắt chước thực sự: Ngưỡng điểm bảo vệ (Mạnh ≥45, Trung bình ≥25, Yếu <25) là tùy ý. Không có bằng chứng cho thấy:

Điểm 45 thực sự ngăn cản DreamBooth học phong cách
Điểm 25 cung cấp bất kỳ sự bảo vệ có ý nghĩa nào
Các ngưỡng này tương quan với tỷ lệ thành công/thất bại bắt chước
Limited Transform Suite (): Chỉ kiểm tra 4 biến đổi:/src/auralock/core/style.py:217-231

Danh tính
gaussian_blur (hạt nhân = 5, sigma = 1.0)
resize_restore_75
resize_restore_50
Thiếu nhiều bước tiền xử lý phổ biến mà các mô hình bắt chước sử dụng (tiền xử lý CLIP, mã hóa VAE, tăng cường dữ liệu).

Tại sao điều này có thể gây hiểu lầm cho người dùng
Tình huống 1: Niềm tin sai

User protects artwork, sees "Strong" protection (score=48.2)

Reality: DreamBooth can still successfully learn the style

because ResNet18 drift ≠ CLIP/VAE feature preservation

Tình huống 2: Bề mặt tấn công không đo lường
Người dùng tin rằng tác phẩm nghệ thuật của họ được bảo vệ khi:

Điểm bảo vệ cao trong không gian tính năng ResNet18
Nhưng thông tin kiểu vẫn có thể khôi phục được trong không gian CLIP / VAE
Các mô hình bắt chước thực tế hoạt động trong không gian không được giám sát
Tình huống 3: So sánh gây hiểu lầm
Các tuyên bố của README (dòng 52-58):

| fortress | 53.2 | 29.08 | 0.7858 | more aggressive, visibly harsher output |
| blindfold | 61.1 | 26.53 | 0.6114 | strongest current anti-readability preset |
Nhưng không có bằng chứng nào cho thấy những hồ sơ này thực sự ngăn chặn sự bắt chước. Điểm số là các phép đo tương đối trong không gian proxy, không phải đảm bảo bảo vệ tuyệt đối.

Bằng chứng từ kho lưu trữ
Không có nghiên cứu tương quan cơ sở-sự thật: Tìm kiếm xác nhận rằng điểm bảo vệ dự đoán ngăn ngừa bắt chước:

/src/tests/test_metrics.py: Kiểm tra tính toán số liệu, không tương quan với thành công bắt chước
/src/tests/test_stylecloak.py: Kiểm tra tính điểm bảo vệ, không phải ngăn chặn bắt chước
Không có thử nghiệm nào xác nhận rằng điểm bảo vệ cao ngăn chặn sự bắt chước thực tế
Được thừa nhận là Proxy (dòng 60 trong README):

"Đây là một proxy nội bộ bắt nguồn từ việc nhúng và tương đồng kiểu dáng sau khi biến đổi mạnh mẽ. Nó hữu ích cho các so sánh tương đối bên trong kho lưu trữ này, không phải là một sự đảm bảo chung chống lại tất cả các hệ thống AI."Protection Score

Nhưng hạn chế nghiêm trọng này bị chôn vùi trong tài liệu, không được hiển thị nổi bật trong kết quả.

Khai thác điểm chuẩn tồn tại nhưng không có kết quả: Kho lưu trữ bao gồm:

/src/auralock/benchmarks/lora.py: Cơ sở hạ tầng chuẩn LoRA
/src/auralock/benchmarks/antidreambooth.py: Điểm chuẩn Anti-DreamBooth
NHƯNG: Không có kết quả được công bố nào tương quan điểm bảo vệ với kết quả bắt chước thực tế
Đề xuất nâng cấp điểm chuẩn

  1. Nghiên cứu xác nhận sự thật cơ sở
    Mục tiêu: Đo lường mối tương quan giữa điểm bảo vệ và phòng chống bắt chước thực tế.

Giao thức:

For each profile (safe, balanced, strong, fortress, blindfold):

  1. Protect N=50 diverse artworks
  2. Record protection score for each
  3. Train DreamBooth/LoRA on protected images:
    • Use standard settings (resolution=512, steps=400)
    • Generate M=10 samples per trained model
  4. Measure mimicry success rate:
    • Human evaluation: Does generated image match original style?
    • Automated: CLIP similarity to original style exemplars
  5. Compute correlation: protection_score vs mimicry_success_rate
    Sản lượng dự kiến:

Biểu đồ phân tán: protection_score (trục x) so với mimicry_prevention_rate (trục y)
Phân tích hồi quy với giá trị R²
Hiệu chuẩn lại ngưỡng dựa trên dữ liệu thực nghiệm
2. Đánh giá tính năng đa không gian
Thay thế ResNet18 đơn bằng quần thể:

Current (biased)

extractor = resnet18(weights=ResNet18_Weights.DEFAULT)

Proposed (comprehensive)

extractors = {
'resnet18': resnet18(weights=ResNet18_Weights.DEFAULT),
'clip_vit': CLIPVisionModel.from_pretrained('openai/clip-vit-base-patch32'),
'dino_vit': torch.hub.load('facebookresearch/dino:main', 'dino_vits16'),
}

Aggregate protection across all spaces

protection_score_ensemble = mean([
score_from_extractor(extractors[name])
for name in extractors
])
Lý do: Nếu bảo vệ hoạt động trong ResNet18 nhưng không thành công trong không gian CLIP, khả năng bảo vệ tổng thể yếu vì các mô hình bắt chước sử dụng CLIP.

  1. Biến đổi cụ thể bắt chước
    Mở rộng bộ biến đổi để phù hợp với quá trình tiền xử lý mô hình bắt chước thực tế:

def build_mimicry_aligned_transform_suite():
return (
("identity", identity),
("gaussian_blur", gaussian_blur),
("resize_restore_75", resize_restore_75),
("resize_restore_50", resize_restore_50),
# NEW: Match actual preprocessing
("clip_preprocess", clip_preprocessing_pipeline),
("vae_encode_decode", vae_roundtrip),
("jpeg_compress_90", jpeg_compression_90),
("jpeg_compress_70", jpeg_compression_70),
("random_crop_center", center_crop_and_resize),
("color_jitter", color_jitter_augment),
)
4. Báo cáo riêng biệt: Proxy vs Ground-Truth
Phân biệt rõ ràng trong tất cả các đầu ra:

{
"proxy_metrics": {
"protection_score_resnet18": 48.2,
"assessment": "Strong (proxy space)",
"warning": "This score measures drift in ResNet18 features, NOT actual mimicry prevention"
},
"ground_truth_metrics": {
"mimicry_prevention_rate": null,
"reason": "Not yet evaluated. Run auralock benchmark-lora --execute to validate.",
"status": "requires_gpu_validation"
}
}
Tiêu chí chấp nhận
Giai đoạn 1: Sửa lỗi ngay lập tức (Tuần 1-2)
Thêm cảnh báo nổi bật vào tất cả các đầu ra điểm bảo vệ:
Đầu ra CLI: "⚠️ Điểm bảo vệ là một chỉ số proxy. Hiệu quả trong thế giới thực không được xác nhận."
Báo cáo JSON: Bao gồm trường"metric_type": "proxy_unvalidated"
README: Di chuyển cảnh báo từ dòng 60 lên đầu bảng kết quả (dòng 52-58)
Giai đoạn 2: Nghiên cứu tương quan (Tháng 1-2)
Thiết kế giao thức xác nhận sự thật cơ bản (tài liệu thông số kỹ thuật chi tiết)
Triển khai các công cụ đo lường tỷ lệ thành công bắt chước
Chạy nghiên cứu xác thực trên N = 50+ tác phẩm nghệ thuật × 5 hồ sơ = 250+ bài kiểm tra
Xuất bản phân tích tương quan: protection_score so với mimicry_prevention_rate
Hiệu chỉnh lại ngưỡng (Mạnh/Trung bình/Yếu) dựa trên dữ liệu thực nghiệm
Giai đoạn 3: Bảo vệ đa không gian (Tháng 2-3)
Thực hiện đánh giá đa bộ trích xuất (ResNet18 + CLIP + DINO)
Thêm các phép biến đổi căn chỉnh bắt chước (tiền xử lý CLIP, VAE, JPEG, CẮT)
Báo cáo điểm bảo vệ trên mỗi không gian và điểm tổng hợp
Cập nhật các bài kiểm tra để xác thực bảo vệ không gian chéo
Giai đoạn 4: Báo cáo trung thực (Đang diễn ra)
Tất cả các kết quả điểm chuẩn bao gồm cả chỉ số proxy và thực tế cơ bản
Kiểm tra CI/CD đảm bảo cảnh báo có trong tất cả các báo cáo
Tài liệu phân biệt rõ ràng các chỉ số proxy với các biện pháp bảo vệ đã được xác thực
Các tài liệu hướng đến người dùng không bao giờ yêu cầu bảo vệ "Mạnh mẽ" mà không có xác nhận sự thật cơ bản
Bối cảnh bổ sung
Vấn đề này không phải là loại bỏ điểm bảo vệ - nó phục vụ một mục đích hữu ích để lặp lại nhanh chóng trong quá trình phát triển. Vấn đề là:

Phụ thuộc quá mức vào proxy mà không có xác thực sự thật cơ bản
Trình bày gây hiểu lầm ngụ ý điểm số đo lường sự bảo vệ thực tế
Thiếu các nghiên cứu tương quan để hiệu chỉnh proxy chống lại sự bắt chước thực sự
Cách khắc phục là:

Xác thực proxy dựa trên kết quả thực tế
Hiệu chỉnh lại ngưỡng dựa trên dữ liệu thực nghiệm
Báo cáo trung thực về những gì chỉ số thực sự đo lường
Mở rộng đánh giá cho các không gian tính năng mà mô hình bắt chước thực sự sử dụng

Metadata

Metadata

Labels

No labels
No labels

Projects

No projects

Milestone

No milestone

Relationships

None yet

Development

No branches or pull requests

Issue actions