PebblousTangible Data / DINOv3

DINOv3 — 잎 사진은 어떻게 다른 표현이 되는가

우간다 밭에서 촬영한 강낭콩 잎을 통해, 신경망이 만든 이미지의 관계와 데이터 선택의 근거를 살펴봅니다. 모델을 소개하는 페이지이자, 실제 사진과 고차원 수치를 오가는 연구 워크벤치입니다.

같은 잎, 다른 이웃

300장을 네 가지 DataLens로 봅니다. 렌즈를 바꾸면 가까운 이미지와 H의 선택 결과도 달라집니다.

출력뿐 아니라 층 안으로

3장의 실제 중간 텐서와 6장의 패치 유사도를 탐색합니다. 차이가 변하는 지점을 볼 수 있지만, 그것이 곧 ‘병을 알아본 순간’은 아닙니다.

60%를 줄였을 때, +3.35%p

DINOv3-L 공간에서 300→120장 선택 시 H의 균형 정확도는 클래스 수를 맞춘 무작위 선택보다 높았습니다. 이 조건의 결과이며 모든 렌즈·데이터에 일반화하지 않습니다. 조건과 불확실성 보기

읽는 기준: 실제 이미지·임베딩·층별 값은 실측 자료입니다. Gram·EMA 도표는 합성 원리 실험입니다. 유사도 지도는 attention이나 인과적 설명이 아니며, 이 웹은 작물 진단 서비스가 아닙니다.

이 잎 사진은 어디에서 왔을까?

데이터가 만들어진 이유와 사진 밖의 맥락을 알아야, 임베딩의 분리를 올바르게 읽을 수 있습니다.

농가의 현장 진단을 돕기 위한 iBean

Makerere AI Lab과 우간다 국립작물자원연구소(NaCRRI)가 우간다 여러 지역의 밭에서 스마트폰으로 수집했습니다. NaCRRI 전문가가 수집 현장에서 잎의 상태를 분류했습니다. 2020년 공개된 원 프로젝트의 목표는 농민이 현장에서 사용할 수 있는 강건한 모바일 병해 분류 모델입니다.

여기서 beans는 대두가 아니라 common bean, 강낭콩류(Phaseolus vulgaris)입니다. 잎의 병반, 잎맥, 색과 질감뿐 아니라 배경·조명·촬영 각도도 함께 담긴 현장 사진입니다.

출처: 수집 기관의 iBean 설명·MIT 라이선스 · 작물·병해 설명

전체 데이터 ≠ 이 실험의 300장

공식 배포 카탈로그
1,295장 · 학습 1,034 / 검증 133 / 시험 128
이 탐색기의 부분집합
학습 이미지 300장 · 클래스별 100장 · 원본 500 × 500 RGB
기존 H 실험의 평가
별도 128장을 검증 65 / 최종 평가 63으로 분할
깊이 들여다보는 범위
패치 6장 · 층별 텐서 3장 · 나머지는 원본과 최종 임베딩 제공

출처: TensorFlow Datasets · 현재 이미지 명세 · 현재 실험 프로토콜

버전 주의: 원저자 README의 클래스 수 합계는 1,296장입니다. 배포 카탈로그의 1,295장과 1장 차이가 있으며, 이번 작업에서 그 원인은 확인하지 못했습니다.

어떤 연구에 쓰였나?

공개 병해 이미지 분류 벤치마크로 사용됩니다. 예를 들어 2025년 Frontiers in Plant Science 연구는 iBean 1,295장으로 주파수 기반 전처리와 Transformer 병해 분류를 평가했습니다. 우리는 새 진단 모델의 순위를 매기기보다, 고정된 임베딩 공간·층별 표현·H 표본 선택이 어떻게 달라지는지 연구합니다. 외부 논문의 성능은 분할과 평가 조건이 달라 직접 비교하지 않습니다.

세 개의 라벨, 서로 다른 생물학적 의미

아래는 기존 최종 임베딩 공간에서 선정한 설명용 중심 사례입니다. 클래스 전체의 대표성을 입증하거나 사진만으로 병원체를 확진한 예시는 아닙니다.

실제 beans 표본 094, 모무늬병으로 분류된 잎

모무늬병 — 잎맥 사이의 각진 병반

Pseudocercospora griseola라는 곰팡이가 원인입니다. 잎맥에 막혀 각진 회갈색 병반이 생길 수 있고, 병이 심해지면 잎이 일찍 떨어져 생산에 영향을 줍니다. 같은 이름의 오이 세균병과는 다릅니다.

관찰 질문: 가까운 이웃도 병반의 형태를 공유할까요, 아니면 잎·배경의 색이 더 비슷할까요?

Pacific Pests, Pathogens & Weeds 질병 자료

실제 beans 표본 183, 녹병으로 분류된 잎

녹병 — 녹가루 같은 포자 덩어리

Uromyces appendiculatus라는 곰팡이가 원인입니다. 작게 솟은 적갈색 포자 덩어리와 노란 테두리가 특징이며, 심한 감염은 잎의 건조·조기 낙엽과 꼬투리·종실 발달 저하로 이어질 수 있습니다.

관찰 질문: 작은 점의 질감은 패치와 층에 따라 어떻게 표현될까요? 유사도만으로 모델의 판단 이유를 확정할 수는 없습니다.

Nebraska Extension · Rust of Dry Bean

실제 beans 표본 256, 건강으로 분류된 잎

건강 — 데이터셋의 비교 기준

수집·주석 과정에서 건강으로 분류된 잎입니다. 비교 기준이 되지만, 잠복 감염이나 사진 밖의 문제까지 없다는 실험실 검사 결과는 아닙니다. 세 라벨은 현장의 모든 병해를 포괄하지 않습니다.

관찰 질문: 건강한 잎끼리도 왜 거리가 다를까요? 모양·잎맥·조명·배경 같은 변화도 살펴보세요.

원저자의 클래스 정의·주석 과정

사진은 기존 원본입니다. 탐색 데이터가 준비되면 표본 선택 버튼이 활성화됩니다.

데이터 품질은 어떠한가?

현재 확인된 강점은 전문가 주석, 균형 잡힌 300장, 그리고 기존 특징 공간의 분별 신호입니다. 다만 균형이나 높은 분류 성능만으로 ‘오라벨·중복·누수가 없는 데이터’라고 말할 수는 없습니다.

현재 자산에서 확인

클래스별 100장

현재 명세의 300장 원본과 클래스 수를 확인했습니다. 고유한 파일과 해시는 이미지 식별 근거이지, 서로 닮은 촬영본이 없다는 보증은 아닙니다.

과거 진단의 기록

92.19%와 93.75%는 다른 기록

품질 HTML은 분별성 92.19%·밀도 0.393±0.122·GOOD을, Govern 보고서는 DINOv2-base 분별성 93.75%·5-fold CV 89.72±2.25%를 기록합니다. 현재 DINOv3의 품질 점수로 치환하지 않습니다.

이 보고서의 한계

현장 일반화는 아직 별도 문제

촬영 농가·식물 개체의 독립성, 유사 촬영본의 분할 누수, 전문가 간 주석 일치도, 배경 편향은 이번 작업에서 새로 검증하지 않았습니다. 질병 부위를 실제로 사용하는지는 추가 실험이 필요합니다.

그린하우스 수치의 조건·상충 기록·정정 사항

Govern의 라벨 셔플 30회 평균은 35.89%, 보고된 p값은 0.0323입니다. 이는 해당 검사에서 라벨과 특징의 연관 신호가 있다는 근거이며, 모든 누수 가능성을 배제하지 않습니다. 원시 반복 실행은 이번에 재현하지 않았습니다.

현재 저장된 cross-eval JSON의 DINOv2-base 자체 공간에서는 300장 93.75%, 253장 선택 92.19% 대 무작위 95.31%(차이 −3.12%p)입니다. 2026-08-15 권고는 유지 비율 0.843·BAD/caution을 기록합니다. 과거 품질 HTML의 ‘85.7% 감량 여력·GOOD’과 하나의 일관된 권고로 합칠 수 없습니다.

이 cross-eval은 기존 감사 기록상 로지스틱 회귀·accuracy·단일 무작위 선택 조건입니다. 아래의 MLP·균형 정확도·반복 seed·클래스 수를 맞춘 H 실험과는 다른 실험입니다. 두 기록의 300장이 현재 웹과 파일 단위로 같은 집합인지는 미확인입니다.

또한 2026-07-10 정정 원장은 일부 beans 파생셋의 ‘lens_diet’ 표기가 실제 층화 무작위 절삭이었다고 정정합니다. 그 결과를 정밀 H 선택의 증거로 가져오지 않습니다. 이번 변경은 운영 데이터나 과거 기록을 덮어쓰지 않습니다.

2026-09-25 로컬 기록 대조 · 파일 해시·값·제약을 담은 근거 원장 · 전체 Markdown 보고서

이미지에서 이웃으로

점이나 이웃 이미지를 선택하면
원본과 상세 정보가 함께 바뀝니다.

DataLens
동일 표본 · 렌즈별 비교
실험 데이터를 불러오는 중…3D / PCA
드래그 회전 · 휠 확대 · 점 클릭

고차원 이웃 8

cosine 유사도 순 · 자신 제외
모무늬병녹병건강

좌표는 렌즈별 L2 정규화 → 중심화 → PCA. 선은 원공간에서 정확히 계산한 상위 8개 cosine 이웃입니다. 3D 거리와 원공간 거리는 같지 않으며, 렌즈 간 축도 정렬하지 않았습니다.

같은 신경망을 통과하는,
서로 다른 세 장의 잎

이미지 쌍과 단계를 바꾸며 실제 숫자가 달라지는 과정을 확인합니다. 학습을 마친 모델의 관측값이며, 새로 학습하는 과정이 아닙니다.

실제 텐서 · 3장 · 30단계

#094 모무늬병 · #183 녹병 · #256 건강. 최종 임베딩 공간에서 고른 클래스별 중심 설명 사례이며, 클래스 전체를 대표하는 증거가 아닙니다.

최종 임베딩 3D로 ↑DINOv3-L 고정 · 추가 추론 없음
저장된 층별 자료를 불러오는 중입니다…
추출 위치·모델·전처리·재현 검증
전체 manifest ↓

패치 지도는 두 이미지의 같은 격자 위치를 비교합니다. 같은 잎 부위라는 보장은 없습니다. attention이나 인과적 설명이 아니며, 아래의 ‘한 이미지 내부 패치 유사도’ 및 ‘합성 Gram 실험’과 분석 대상이 다릅니다. 기존 3D는 최종 CLS의 보조 투영입니다. 층마다 별도로 만든 3D 좌표를 연결하지 않았습니다.

하나의 점을 열면,
196개의 패치가 있습니다.

6장의 실제 이미지에서 패치 특징을 추출했습니다. 아래 표본을 선택하면 위 3D 탐색기도 같은 이미지로 이동합니다. 전처리 이미지의 한 칸을 눌러, 다른 영역과의 패치 특징 유사도를 확인하세요.

이 지도는 attention 가중치나 인과적 설명이 아닙니다. 특정 패치가 분류 결과를 일으켰다는 뜻도 아닙니다.

클래스별 중심부 1장 + 주변부 1장. 기존 DINOv3 CLS 공간에서 같은 클래스 평균과의 유사도가 가장 높은/낮은 표본입니다. 통계적 대표성이나 오라벨을 뜻하지 않습니다.

실제 패치 자료를 불러오는 중…패치 모델: DINOv3-L 고정3D에서 보기 ↑

보이는 색까지, 계산 경로를 남깁니다.

RGB 원본 → 1/255 스케일링 → bilinear·antialias 224×224 리사이즈 → ImageNet 채널 정규화 → 고정 ViT-L 추론 → CLS·register 5개 제외 → 패치별 L2 정규화 → cosine 내적.

잘라내기(crop)는 없습니다. 표시한 입력 이미지는 모델 입력 텐서의 채널 정규화를 되돌리고 8비트 PNG로 저장한 것입니다. 원본 500×500 전체와 대응하며, 픽셀 좌표는 크기 비율에 따라 바뀝니다.

모델·전처리·검증 근거
추론 manifest 내려받기 ↗

여기는 학습 완료 모델의 실제 특징입니다. 아래의 합성 Gram 실험은 관계 보존의 수학을 설명하는 별도 모형입니다. 이 6장으로 Gram anchoring의 학습 전후 효과를 측정한 것은 아닙니다.

사진 한 장이
토큰의 대화로 바뀝니다.

ViT는 이미지를 작은 패치로 나눕니다. 각 패치를 벡터로 바꾼 뒤, self-attention으로 서로의 정보를 섞습니다. 패치 출력은 더 이상 그 조각의 픽셀만이 아니라, 전체 문맥을 함께 담습니다.

패치에서 시퀀스로 구조 설명도
256PATCH TOKENS
1 + 4CLS + REGISTERS
261TOTAL TOKENS

CLS는 이미지 전체를 요약하는 학습된 토큰입니다. ViT-L에서는 1,024차원의 이미지 표현을 얻습니다.

16 × 16 픽셀↓ 선형 투영토큰 + 위치 정보(RoPE)↓ attention · MLP · 잔차 연결문맥을 반영한 벡터

Attention(Q, K, V)
= softmax(QKᵀ / √dk) V

각 토큰은 Q(질문), K(주소), V(전달할 내용)를 만듭니다. Q와 K가 결정한 가중치로 V를 모아 표현을 갱신합니다. RoPE는 위치에 따라 Q·K를 회전시켜 상대적 공간 관계를 반영합니다.

표준 attention의 개념식입니다. DINOv3의 세부 위치 처리와 정규화는 공식 구현을 따릅니다. Attention 가중치가 곧 인과적 설명인 것은 아닙니다.

근거: 공식 ViT 구현 ↗
THE COST OF DETAIL

해상도는 두 배,
관계의 수는 약 열여섯 배.

패치 수는 면적에 비례하고, 토큰 간 attention 관계는 N²으로 늘어납니다. 아래는 실행시간이 아닌 관계 수의 계산입니다.

정답 대신,
스스로 만든 목표를 배웁니다.

학생은 서로 다르게 자른 이미지를 봅니다. 교사는 더 넓은 시야를 제공합니다. 학생이 맞추는 것은 ‘콩잎’이라는 정답 이름이 아니라, 교사의 학습용 헤드가 만든 확률분포입니다.

ONE IMAGE같은 이미지의
서로 다른 시야
큰 crop 2개 · 작은 crop 8개
사전학습 설정
TEACHER · θt큰 crop만 관찰역전파 없음 · EMA로 갱신
STUDENT · θs큰 crop + 작은 crop일부 패치 마스킹 · 역전파로 학습
학습용 헤드확률분포 비교서로 다른 시야의 일관성
+ 가려진 패치의 의미 예측

교사는 과거 학생들의
부드러운 평균입니다.

자기증류 사전학습에서는 학생의 가중치를 바로 복사하지 않고, 교사 가중치에 조금씩 섞습니다. EMA는 목표의 급격한 흔들림을 줄입니다.

θt ← mθt + (1 − m)θs

EMA만으로는 모든 이미지가 같은 벡터가 되는 ‘붕괴’를 막기에 충분하지 않습니다. 목표 분포의 균형화(Sinkhorn–Knopp), 온도 조절, KoLeo 정규화 등이 함께 작동합니다.

교사는 얼마나 천천히 따라올까? 수학 모형
학생의 가상 가중치EMA 교사

160단계의 합성 1차원 궤적입니다. 실제 훈련 로그가 아닙니다. m이 클수록 변화가 부드러워지고 반응은 늦어집니다. 논문의 대규모 사전학습 설정은 m = 0.999입니다.

근거: 논문 §3.2 · 공식 loss 구현 ↗

좌표를 붙잡지 않고,
관계를 붙잡습니다.

사진 전체를 잘 분류한다고 모든 부분을 잘 이해하는 것은 아닙니다. DINOv3의 Gram anchoring은 패치 쌍의 유사도 구조를 참조 교사에 맞추어, 장기 학습 중 무너질 수 있는 국소 표현을 보완합니다.

합성 벡터 · 원리 실험

관계 보존 실험실

12개 패치를 6차원 벡터로 가정했습니다. 교란을 키우고, 참조 벡터로 되돌리는 양을 조절해 보세요.

관계 오차 · 평균제곱오차

보간은 설명용 조작이며 실제 최적화 과정이나 loss 가중치가 아닙니다. 회전 전후의 Gram 오차는 같습니다.

참조 교사 Gteacher

학생 Gstudent

−1 반대 방향+1 같은 방향

가로·세로 축은 패치 번호 0–11. 대각선은 자기 자신과의 유사도 1입니다.

행렬의 수치 표 보기
G = FFᵀ
LGram = ‖Gstudent − Gteacher‖²F

F의 각 행은 L2 정규화한 패치 벡터입니다. 좌표계를 회전해 FQ로 바꾸어도 Q가 직교 행렬이면 (FQ)(FQ)ᵀ = FFᵀ입니다. 즉, 표현이 움직일 자유를 남기면서 관계의 구조를 보존할 수 있습니다.

이 행렬은 한 이미지 내부 패치들의 관계입니다. 맨 위의 ‘300장 이미지 사이의 이웃 그래프’와는 분석 단위가 다릅니다. 위 실험은 논문 개념식의 평균제곱 형태를 사용하며, 공식 구현의 음수 유사도 제거 등 선택 옵션은 적용하지 않습니다.

근거: 논문 §4 · GramLoss 구현 ↗

DINOv3는 하나의 크기가
아닌 모델 계열입니다.

대규모 ViT-7B 교사의 표현을 작은 모델에 증류합니다. 우리가 사용한 ViT-L의 1,024차원은 이미지 벡터의 길이이지, 모델의 파라미터 수가 아닙니다.

1

대규모 자기지도 사전학습

학생 + EMA 교사
DINO · iBOT · KoLeo

2

관계 정제와 해상도 적응

별도의 Gram 교사 참조
패치 간 관계 보완

3

작은 모델로 증류

고정된 7B 교사 → S / B / L / H+
작은 모델에 Gram loss를 그대로 재적용하는 것은 아님

크기와 표현 차원의 차이 공식 모델 카드
ViT 모델파라미터임베딩 차원
S21M384
S+29M384
B86M768
L ← 이번 실험300M1,024
H+840M1,280
7B6,716M4,096

M = 백만 파라미터. 모델 카드의 반올림 수치입니다. ViT 계열은 패치 크기 16, register 4개를 사용합니다. 별도의 ConvNeXt 계열도 제공됩니다.

모델 카드 ↗

좋은 렌즈는
좋은 선택을 보장할까요?

기존 beans 실험에서 300장 중 120장을 남겼습니다. H와 같은 클래스 구성의 무작위 선택을 비교하자, 평가에 사용하는 렌즈에 따라 차이가 달랐습니다. 이 결과는 DINOv3 전체의 우열 순위가 아닙니다.

H − 무작위 선택의 Balanced Accuracy 기존 로컬 실험 · %p

점은 평균, 선은 95% 교차 부트스트랩 구간입니다. 같은 렌즈로 선택하고 평가한 self-space 결과. 선택 seed 3개 × 학습 seed 3개, 10,000회 재표집. raw 특징을 입력으로 하는 MLP로 평가했으며, held-out 128장 중 검증 65장·최종 평가 63장을 사용했습니다. 구간은 테스트 표본이나 데이터셋 간 불확실성을 모두 나타내지는 않습니다.

DINOv3-L의 평균 차이는 +3.35%p입니다. 그러나 선택 결과를 다른 렌즈에서 평가한 경우에는 음의 차이도 있었습니다. ‘Gram anchoring 때문에 H가 좋아졌다’는 인과적 주장은 이 실험만으로 할 수 없습니다.

설명은 그림이 아니라,
추적 가능한 연결입니다.

점이 가까워 보인다는 인상에서 멈추지 않고, 어떤 표현과 거리, 어떤 선택 규칙이 결과를 만들었는지 돌아갈 수 있어야 합니다.

01

표현의 출처

이미지 ID · 전처리
모델 revision · 토큰 정책

02

원공간의 관계

FAISS 후보 생성
정식 H 커널로 재정렬

03

선택의 근거

OOF hardness · 밀도
경계 · 중복 · 보호 규칙

04

결과의 검증

보존 / 제거 이력
무작위 대조 · 교차 렌즈 평가

연구 워크벤치가 추적해야 할 개념적 증거 사슬입니다. 이 교육용 리포트는 고차원 cosine 이웃과 저장된 선택 결과를 보여 주며, FAISS/H 재실행이나 개별 결정의 전체 근거 추적 기능을 구현한 것은 아닙니다.

PebbloScope와의 역할 경계

Pebblous가 개발하는 PebbloScope의 API 저장소에서는 데이터셋 카탈로그, 2D/3D PCA 시각화 자산, 노드 미리보기, 색 매핑, 스냅샷 기능을 확인했습니다. 범용 공간 탐색은 이 계층을 재사용하고, Data Clinic 연구 워크벤치는 H의 의사결정·실험 근거를 책임지는 구분이 적절합니다.

검토 기준: 저장소 로컬 체크아웃 d39926d. 실제 서비스의 현재 배포 API와 동일하다고 검증한 것은 아닙니다. 이 리포트는 교육용 독립 산출물이며 PebbloScope나 기존 Data Clinic의 운영 기능을 대체·수정하지 않습니다.

무엇을 관찰했고,
무엇을 가정했는가.

실측 데이터, 원리 설명 모형, 연구 해석을 구분했습니다. 300장 원본·기존 CLS·기존 6장 패치 특징을 재사용했습니다. 층별 탐색은 기존 환경에서 3장과 반복 확인 1회만 추가 추론했습니다. 새 학습·다운로드·전체 재추론은 없습니다.

Markdown 보고서 내려받기 ↓

데이터와 계산

  • 실측: beans 학습 300장, 3개 클래스 각 100장. 기존에 추출한 4종 고차원 벡터를 사용합니다.
  • 실제 패치: 이전 단계에서 DINOv3-L 가중치로 추론한 6장 + 반복 확인 1회의 결과를 그대로 사용합니다. 원본·입력·패치 cosine의 출처를 별도 기록합니다.
  • 층별 실제 텐서: #094·#183·#256의 30단계를 기록했습니다. 입력·토큰·24개 블록·최종 정규화를 구분하며, 기존 최종 패치와 일치합니다. 층별 manifest
  • 원본: 300장 모두 기존 데이터 목록의 SHA-256과 대조했습니다. 썸네일은 표시 크기만 줄이며 원본을 재인코딩하지 않았습니다. 이미지 목록·해시
  • 투영: L2 정규화 → 평균 중심화 → SVD 기반 PCA 3축. 렌즈마다 독립 계산합니다.
  • 이웃: 원공간 cosine 전수 비교, 자기 자신 제외 상위 8개. FAISS 근사 탐색이나 H 커널 순위가 아닙니다.
  • 합성: EMA 궤적과 Gram 실험은 수학적으로 구성한 예제입니다. 실제 attention·훈련 로그·성능 측정값이 아닙니다.
모델 revision과 데이터 무결성

일차 자료

  1. Siméoni et al. · DINOv3 (2025)§3 학습 · §4 Gram · §5 증류 · Appendix C
  2. Meta · 공식 코드와 모델 카드고정 commit 6876159 · ViT / loss / config
  3. Pebblous · PebbloScope API로컬 체크아웃 기준 · 접근 권한이 필요할 수 있음
  4. 이 리포트의 파생 데이터 JSON좌표 · 이웃 · 선택 상태 · 효과 · 출처 해시

한계: 3D 지도는 고차원 구조의 일부만 보여 줍니다. 클래스 색은 사람이 부여한 사후 표시이며, DINO의 학습 목표 이름이 아닙니다. 임베딩의 개별 좌표를 ‘병변 정도’ 같은 의미로 읽을 수 없고, 작은 단일 데이터셋의 결과를 다른 문제에 일반화할 수 없습니다.

원본 이미지

원본 500 × 500 픽셀 · 200%는 표시 크기만 확대합니다. 새 정보나 추론을 추가하지 않습니다.

원본 파일과 무결성

SHA-256