Chapter 04

컬러 필터와 디모자이킹

실리콘 포토다이오드는 들어온 광자의 개수만 셀 뿐, 그 광자가 빨간색이었는지 파란색이었는지는 모릅니다. 스마트폰 사진의 풍부한 색은 픽셀마다 얹힌 작은 색 필터와, 빠진 두 색을 이웃에서 추정해 채워 넣는 계산 — 디모자이킹 — 이 함께 만들어 낸 결과입니다.

센서는 색을 모른다

2장에서 본 것처럼 포토다이오드는 밴드갭보다 큰 에너지의 광자를 흡수해 전자–정공 쌍을 만듭니다. 이때 만들어진 전자는 450 nm 광자에서 왔든 650 nm 광자에서 왔든 똑같은 전자 하나입니다. 파장 정보는 흡수 순간에 사라지고, 픽셀이 노출 시간 동안 모은 것은 오직 전자의 개수, 즉 스칼라 하나뿐입니다. 그래서 이미지 센서는 본질적으로 흑백 광자 카운터(monochrome photon counter)입니다.

450 nm · 2.76 eV 550 nm · 2.25 eV 650 nm · 1.91 eV 포토다이오드 (Si) e⁻ e⁻ e⁻ 모두 같은 전자 출력 = N = 3 파장 정보 없음 흡수 순간 광자의 에너지(파장)는 잊히고, 픽셀은 "몇 개가 들어왔나"만 기록한다.
그림 4-1. 포토다이오드는 파장을 구분하지 못한다. 파장에 따라 달라지는 것은 흡수 확률(QE)과 흡수 깊이뿐이며, 출력은 전자 수라는 하나의 숫자다.

물론 파장에 따라 흡수될 확률(양자효율, QE)과 흡수 깊이는 다릅니다. 이 깊이 차이를 이용해 한 픽셀에서 세 색을 층층이 분리하는 적층형 포토다이오드(Foveon X3)도 있었지만, 층 간 분광 분리가 넓고 겹쳐서 색 노이즈가 커지는 한계가 있었습니다. 오늘날 거의 모든 센서가 택한 해법은 훨씬 단순합니다. 픽셀마다 색 필터 하나를 얹어서, 그 픽셀이 특정 파장대의 광자만 세도록 만드는 것입니다. 대가는 분명합니다. 각 픽셀은 세 색 중 한 색만 측정하므로, 나머지 두 색은 계산으로 추정해야 합니다.

이 장의 큰 그림

색 정보 = 분광 필터링(어느 광자를 셀지 고름) + 공간 샘플링(색마다 픽셀 일부만 할당) + 보간(빠진 색 추정). 앞의 둘은 하드웨어, 마지막은 ISP(9장)의 일입니다. 색 오차, 노이즈, 모아레는 모두 이 세 단계 중 어딘가에서 생깁니다.

인간 시각과 삼원색

카메라가 "올바른 색"을 재현한다는 말은 결국 사람 눈에 같은 색으로 보이게 한다는 뜻입니다. 따라서 카메라 색 설계의 기준은 인간 시각입니다. 망막의 원추세포(cone)는 세 종류이며, 각각 짧은(S, 약 440 nm), 중간(M, 약 540 nm), 긴(L, 약 565 nm) 파장에 감도 정점이 있습니다. 눈으로 들어온 스펙트럼 \( L(\lambda) \)는 이 세 세포의 반응이라는 세 개의 숫자로 압축됩니다.

S M L 380480 580680 nm 10 M과 L은 크게 겹친다 → 빨강–초록 구분은 "차이" 신호로 계산
그림 4-2. 세 원추세포의 정규화 분광 감도(근사). 곡선이 서로 많이 겹친다는 점이 중요하다. 카메라 필터도 일부러 겹치게 만든다.

1931년 국제조명위원회(CIE)는 색 맞춤 실험을 바탕으로 원추 반응의 선형 변환인 색 대응 함수(color matching functions) \( \bar x(\lambda), \bar y(\lambda), \bar z(\lambda) \)를 표준화했습니다. 어떤 빛의 색은 삼자극값(tristimulus values) 세 개로 완전히 기술됩니다.

$$X=\int L(\lambda)\,\bar x(\lambda)\,d\lambda,\qquad Y=\int L(\lambda)\,\bar y(\lambda)\,d\lambda,\qquad Z=\int L(\lambda)\,\bar z(\lambda)\,d\lambda$$
\( \bar y(\lambda) \)는 명소시 시감 효율 \( V(\lambda) \)와 같게 정의되어, \( Y \)가 곧 휘도(밝기)다. 선형 sRGB는 XYZ에 3×3 행렬을 곱해 얻는다.

여기서 두 가지 중요한 결론이 나옵니다. 첫째, 스펙트럼은 무한 차원이지만 색은 3차원이므로 스펙트럼이 달라도 같은 색으로 보이는 메타머(metamer)가 존재합니다. 둘째, 카메라도 세 개의 분광 감도 \( s_k(\lambda) \)로 적분한 세 숫자를 얻는데, 이 세 감도가 CIE 함수의 선형 결합이라면 3×3 행렬 하나로 사람과 똑같은 색을 얻을 수 있습니다.

루터–아이브스 조건 (Luther–Ives condition)

카메라 감도 \( [s_R, s_G, s_B]^\top = A\,[\bar x, \bar y, \bar z]^\top \)를 만족하는 행렬 \( A \)가 존재하면 카메라는 "색채계"처럼 완벽한 색을 낸다. 실제 염료·안료 필터로는 이 조건을 정확히 만족시킬 수 없어서, 최소자승으로 가장 가까운 색 보정 행렬(CCM)을 찾아 쓴다. 이 잔차가 곧 카메라 고유의 색재현 오차이며, 메타머 실패(조명이 바뀌면 같은 색이 달라 보이는 현상)의 원인이다. CCM은 9장에서 자세히 다룬다.

컬러 필터 배열과 베이어 패턴

컬러 필터 배열(Color Filter Array, CFA)은 포토다이오드 위, 마이크로렌즈 아래에 놓인 모자이크 형태의 유기 안료 필터 층입니다(두께 약 0.4~0.8 µm). 1976년 코닥의 브라이스 베이어(Bryce Bayer)가 제안한 베이어 패턴은 2×2 단위 셀에 R 1개, G 2개, B 1개를 체크무늬로 배치합니다(RGGB, GRBG, GBRG, BGGR은 시작 위치만 다른 같은 패턴).

단면 (2픽셀) PDPD 마이크로렌즈 컬러 필터 (CFA) 평탄화층 실리콘 · DTI 실선: 필터 통과, 점선: 흡수(차단) 평면 (베이어 RGGB) RGRG GBGB RGRG GBGB 단위 셀2 × 2 R 25%G 50%B 25%
그림 4-3. 픽셀 적층 단면과 베이어 패턴. 각 필터는 자기 대역 밖의 광자를 흡수해 버리므로, 베이어 센서는 입사광의 약 2/3를 필터에서 잃는다.

왜 G가 두 배인가

사람 눈은 밝기(휘도)의 공간 변화에는 예민하고 색(색도)의 공간 변화에는 둔합니다. 휘도 신호는 녹색 성분이 지배합니다. 선형 sRGB의 휘도는

$$Y = 0.2126\,R + 0.7152\,G + 0.0722\,B$$
\( V(\lambda) \)의 정점(555 nm)이 G 필터 대역 안에 있어서, 휘도의 약 72%가 G 채널에서 온다.

로 G의 가중치가 압도적입니다. 따라서 G 샘플을 가장 촘촘하게(체크무늬로, 모든 행과 열에) 배치하면 휘도 해상도를 최대로 확보할 수 있고, R과 B는 절반 밀도로도 사람이 느끼는 화질 손실이 적습니다. JPEG·영상 코덱이 색차 성분을 4:2:0으로 줄이는 것과 같은 원리입니다. 또 G는 실리콘 QE와 태양광 스펙트럼이 모두 높은 대역이라 신호가 가장 크고 SNR이 좋아서, 디모자이킹에서 "기준 채널"로 쓰기에도 적합합니다.

채널샘플 밀도샘플 격자나이퀴스트 주파수 (가로)
G50%체크무늬(45° 회전 정사각)\( 1/(2p) \)
R, B25% 씩피치 \( 2p \) 정사각\( 1/(4p) \)

표에서 보듯 R·B는 가로·세로 나이퀴스트 주파수가 G의 절반입니다. 이것이 뒤에서 볼 색 에일리어싱(위색, 모아레)의 근본 원인입니다.

분광 감도와 IR 컷 필터

한 픽셀의 최종 분광 감도는 광경로에 있는 모든 요소의 투과율과 실리콘 QE의 곱입니다. 채널 \( k \)의 신호는

$$c_k = \int L(\lambda)\;T_{\mathrm{IR}}(\lambda)\;T_k(\lambda)\;\eta_{\mathrm{Si}}(\lambda)\;d\lambda$$
\( T_{\mathrm{IR}} \): IR 컷 필터 투과율, \( T_k \): 컬러 필터 투과율, \( \eta_{\mathrm{Si}} \): 실리콘(마이크로렌즈·반사 손실 포함) 양자효율

유기 안료 컬러 필터는 가시광 안에서는 대역을 잘 나누지만, 800 nm 이상 근적외선에서는 R·G·B 모두 투명해집니다. 그런데 실리콘은 1000 nm 근처까지 감도가 남아 있습니다. IR 컷 필터(보통 커버 글라스 위 다층 유전체 코팅이나 청색 유리 흡수형)가 약 650 nm 위를 잘라내지 않으면 세 채널이 모두 적외선 신호를 받아 색이 탁해지고(채도 저하), 식물·검은 섬유처럼 IR 반사가 강한 물체의 색이 크게 틀어집니다. 아래 시뮬레이터에서 IR 컷을 끄고 700 nm 이상 영역을 보세요.

SIMULATOR

R·G·B 유효 분광 감도 (필터 × Si QE × IR 컷)

RGBSi QE (점선)IR 컷 투과율V(λ)
채널 적분 신호 R:G:B—
R 신호 중 700 nm 이상—
R–G 겹침 / G 신호—
G 정점 QE—
해볼 것: ① IR 컷을 끄면 세 곡선이 800 nm 위에서 다시 올라와 합쳐진다 — 이 영역의 신호는 색 구분 능력이 없는 "공통 성분"이다. ② 차단 파장을 600 nm로 내리면 R 신호가 줄고, 700 nm로 올리면 R이 적외선을 받아 붉은 기가 늘어난다. ③ V(λ)를 켜서 G 곡선과 비교해 보자. (평탄한 광자 스펙트럼 가정, 교육용 근사 모델)

곡선들이 서로 겹쳐 있다는 점에 주목하세요. 겹침이 너무 작으면(예: 좁은 간섭 필터) 두 대역 사이 파장의 빛이 어느 채널에도 잘 잡히지 않아 감도가 떨어지고, 원추세포처럼 겹친 CIE 함수를 흉내 내기도 어렵습니다. 반대로 겹침이 크면 채널 간 상관이 커져, 색을 분리하는 CCM의 비대각 성분이 커지고 노이즈가 증폭됩니다. 필터 설계는 감도, 색 정확도, 노이즈의 절충입니다. 또한 필터 두께가 얇아지는 미세 픽셀에서는 이웃 픽셀로 비스듬히 들어가는 빛에 의한 광학 크로스토크가 늘어, 사실상 겹침이 더 커지는 효과가 생깁니다(9장 CCM에서 보정).

여러 가지 CFA

베이어는 50년 가까이 표준이지만, 픽셀이 작아지고 저조도 성능이 중요해지면서 여러 변형이 등장했습니다. 크게 두 방향입니다. (1) 필터의 투과 대역을 넓혀 감도를 올리는 방향(RGBW, RYYB, RCCB), (2) 같은 색 픽셀을 묶어 고해상도와 고감도 모드를 오가는 방향(쿼드 베이어, 노나셀). 후지필름 X-Trans처럼 배열의 주기성을 흐트러뜨려 모아레를 줄이는 시도도 있습니다.

SIMULATOR

CFA 패턴 뷰어

패턴
특징
—
단위 셀—
색 비율—
평균 신호 (베이어 = 1)—
R/B 샘플 피치—
평균 신호는 이 장의 분광 모델(IR 컷 650 nm, 평탄 스펙트럼)로 각 필터가 통과시키는 광자 비율을 적분해 구한 값이다. W(투명)·Y(노랑) 픽셀이 많을수록 커지지만, 색을 분리하는 정보는 그만큼 줄어든다.
CFA단위 셀장점단점 / 비고
Bayer RGGB2×2단순, 디모자이킹 연구 축적, 색재현 우수광 이용률 약 1/3, R/B 에일리어싱
RGBW4×4 등W 픽셀 감도 약 3배 → 저조도 휘도 SNR 향상색 샘플 희소 → 위색·색 노이즈, W 조기 포화
RYYB2×2Y(=R+G) 필터로 G 대비 약 +40~100% 신호G = Y − R 추정 → CCM 계수 커짐, 색 노이즈
RCCB2×2차량용: 감도·신호등 적색 구분녹색 재현 어려움(보기용보다 인식용)
Quad Bayer (Tetra)4×42×2 비닝 시 큰 픽셀처럼 동작, 픽셀별 노출로 HDR풀 해상도 시 리모자이크 필요, 해상력 손실
Nona (3×3)6×6108 MP급에서 3×3 비닝 → 12 MP리모자이크 난이도 더 큼
X-Trans6×6비주기적 배치 → 모아레 억제, OLPF 생략G 56%, 연산량 큰 전용 디모자이킹
리모자이크 (remosaic)

쿼드 베이어 센서를 풀 해상도로 쓰려면 2×2 같은 색 묶음을 일반 베이어 배열로 재배치하는 리모자이크 연산을 먼저 거친 뒤 일반 디모자이킹에 넣는다. 밝은 곳에서는 리모자이크 풀 해상도, 어두운 곳에서는 비닝(4개 합산, 읽기 노이즈 1회분)으로 SNR을 얻는다. 10장에서 다시 다룬다.

모자이크: RAW 영상의 실체

베이어 센서가 출력하는 RAW 영상은 컬러 사진이 아니라 한 장의 흑백 영상입니다. 다만 각 픽셀이 서로 다른 색 필터 뒤에서 측정되었을 뿐이죠. 수학적으로는 원래 장면의 세 채널 \( I_c(x,y) \)에 색마다 다른 샘플링 마스크 \( m_c \)를 곱해 더한 것입니다.

$$\mathrm{RAW}(x,y)=\sum_{c\in\{R,G,B\}} m_c(x,y)\,I_c(x,y),\qquad m_R=\tfrac{(1+(-1)^x)(1+(-1)^y)}{4},\; m_G=\tfrac{1-(-1)^{x+y}}{2}$$
RGGB 기준(\(x,y\)는 0부터). \( m_B \)는 \( m_R \)을 한 칸씩 민 것. 마스크의 \( (-1)^x \) 항이 주파수 영역에서 스펙트럼을 나이퀴스트 위치로 옮기는 변조로 작용한다.

아래 시뮬레이터의 테스트 장면은 절차적으로 생성한 256×192 영상입니다(하늘과 빛나는 구, 컬러체커 24색, 존 플레이트, 지멘스 스타, 처프·대각 줄무늬, 가는 글자). 보기 모드를 바꿔 "센서가 실제로 본 것"을 확인하고, 영상 위를 움직이거나(마우스) 탭하여(터치) 돋보기로 픽셀을 살펴보세요.

SIMULATOR

장면 → 베이어 RAW 샘플링과 돋보기

보기
돋보기 크기
바로 가기
돋보기 중심 픽셀—
CFA 색—
RAW 값 (10-bit)—
원래 장면 R,G,B—
"RAW (실제 값)"이 센서가 넘겨주는 데이터 그대로다. 컬러체커 빨강 패치 위에서 R 픽셀만 밝고 G·B 픽셀은 어두운 격자무늬, 회색 존 플레이트에서는 세 색이 같은 값을 갖는 것을 확인하자.

회색 물체에서는 세 채널 값이 같으므로 RAW가 매끈하게 보이고, 채도가 높은 영역일수록 2×2 격자무늬가 뚜렷합니다. 디모자이킹은 이 격자무늬 속에서 "같은 위치의 나머지 두 색"을 추정하는 역문제(inverse problem)입니다. 미지수가 관측치의 3배이므로 추가 가정 — 영상이 매끄럽다, 색 채널들이 서로 상관되어 있다 — 없이는 풀 수 없습니다.

디모자이킹 알고리즘

좋은 디모자이킹 알고리즘은 영상에 대한 사전 지식을 얼마나 잘 활용하느냐로 갈립니다. 대표적인 네 가지를 복잡도 순으로 살펴보겠습니다.

RGRGRGBGBGRGRGRGBGBGRGRGR 중심 R(i,j)에서 빠진 색 추정 G: 상하좌우 4개 평균 (쌍선형) B: 대각 4개 평균 (쌍선형) 거리 2의 R: 라플라시안 보정 · Hamilton–Adams: 가로/세로 기울기를 비교해 에지를 가로지르지 않는 방향으로만 보간 · Malvar–He–Cutler: 쌍선형 + ½ × (R의 라플라시안) 고정된 5×5 선형 필터 — 하드웨어 친화적
그림 4-4. RGGB 5×5 이웃. 중심 R 픽셀의 G는 십자 이웃에서, B는 대각 이웃에서 얻는다. 고급 알고리즘은 같은 색(R)의 이웃이 알려 주는 고주파(에지) 정보를 G 추정에 섞어 쓴다.

① 최근접 이웃 (nearest neighbor)

2×2 블록 안에 있는 R, G, B 값을 그대로 복사합니다. 계산은 거의 공짜지만 채널마다 샘플 위치가 서로 반 픽셀~한 픽셀씩 어긋나 있으므로, 에지에서 색 경계가 계단처럼 어긋나며 강한 위색이 생깁니다. 프리뷰나 썸네일용입니다.

② 쌍선형 보간 (bilinear)

각 채널을 0으로 채운 평면(\( m_c I_c \))에 작은 커널을 컨볼루션하는 것과 같습니다.

$$\hat G = (m_G\,I_G) * \frac14\begin{bmatrix}0&1&0\\1&4&1\\0&1&0\end{bmatrix},\qquad \hat R = (m_R\,I_R) * \frac14\begin{bmatrix}1&2&1\\2&4&2\\1&2&1\end{bmatrix}$$
G 위치에서는 커널 중심(1)이 원래 값을 그대로 통과시키고, 빈 위치에서는 이웃 평균이 된다. \( \hat B \)도 \( \hat R \)과 같은 커널.

매끄러운 영역에서는 잘 동작하지만 채널마다 독립적으로 흐리게 만드는 저역 통과 필터라서, 에지 양쪽 값을 섞어 버립니다. 그 결과 가는 선이나 에지를 따라 밝고 어두운 픽셀이 번갈아 나오는 지퍼 효과(zipper artifact)와, R·B의 흐림 정도가 G와 달라 생기는 색 번짐(위색)이 나타납니다.

③ 에지 인지 보간: Hamilton–Adams

핵심 아이디어는 두 가지입니다. (1) 에지를 따라 보간하고, 가로지르지 않는다. (2) 색 채널들은 고주파 성분을 공유한다(색 차이 \( R-G \)는 매끄럽다). R 위치 \( (i,j) \)에서 G를 추정할 때 가로·세로 방향의 기울기를 비교합니다.

$$\Delta_H = |G_{i,j-1}-G_{i,j+1}| + |2R_{i,j}-R_{i,j-2}-R_{i,j+2}|,\qquad \Delta_V = |G_{i-1,j}-G_{i+1,j}| + |2R_{i,j}-R_{i-2,j}-R_{i+2,j}|$$ $$\hat G_{i,j}=\begin{cases}\dfrac{G_{i,j-1}+G_{i,j+1}}{2}+\dfrac{2R_{i,j}-R_{i,j-2}-R_{i,j+2}}{4} & \Delta_H<\Delta_V\\[2mm] \dfrac{G_{i-1,j}+G_{i+1,j}}{2}+\dfrac{2R_{i,j}-R_{i-2,j}-R_{i+2,j}}{4} & \Delta_H>\Delta_V\\[1mm] \text{두 추정의 평균} & \text{같을 때}\end{cases}$$
두 번째 항은 R 채널의 2차 미분(라플라시안)으로 G의 곡률을 보정한다 — 채널 간 상관을 이용하는 부분.

G 평면을 모두 채운 뒤에는 R과 B를 직접 보간하지 않고, 매끄러운 색차 \( R-\hat G \), \( B-\hat G \)를 쌍선형 보간한 다음 \( \hat G \)를 다시 더합니다. 색차는 에지에서도 크게 변하지 않으므로 위색이 크게 줄어듭니다.

④ Malvar–He–Cutler (MHC, 2004)

MHC는 "쌍선형 추정 + 같은 위치에서 측정된 색의 라플라시안 보정"을 고정된 5×5 선형 필터로 만든 것입니다. 예를 들어 R 위치의 G는

$$\hat G_{i,j}=\frac18\left[\,4R_{i,j}+2\!\!\sum_{\text{십자}}\!G-\!\!\sum_{\text{거리 2}}\!R\,\right]\quad\Longleftrightarrow\quad \frac18\begin{bmatrix}0&0&-1&0&0\\0&0&2&0&0\\-1&2&4&2&-1\\0&0&2&0&0\\0&0&-1&0&0\end{bmatrix}$$
이득 계수(½, ⅝, ¾)는 코닥 영상 세트에서 최적화된 값. 비선형 판정이 없어서 하드웨어 파이프라인에 넣기 쉽다.

비선형 판정이 없으므로 방향성 에지에서는 HA보다 약간 불리할 수 있지만, 쌍선형보다 훨씬 선명하고 PSNR이 수 dB 높습니다. 최신 ISP는 여기에 방향 판정, 잔차 보간(RI), 딥러닝 기반 공동 디모자이킹·노이즈 제거까지 결합합니다.

SIMULATOR

디모자이킹 비교 — 지퍼, 위색, 모아레

알고리즘
보기
관찰 위치
PSNR (전체)—
PSNR (돋보기 영역)—
위색 지수 (회색 영역)—
연산 시간—
위색 지수 = 원래 무채색인 존 플레이트·스타·줄무늬 영역에서 출력의 평균 채도(max−min, 8-bit). 원본은 0이다. 해볼 것: 쌍선형 → HA → MHC 순서로 존 플레이트 바깥쪽 고주파 링의 무지개색 모아레, "SENSOR" 글자 가장자리의 지퍼 무늬를 비교하자. 이어서 OLPF를 켜 보면 위색은 줄지만 PSNR(선명도)은 어떻게 되는가?
PSNR만 보면 안 되는 이유

PSNR은 평균 제곱 오차에 기반해 영상 전체를 한 숫자로 요약한다. 넓고 매끈한 영역이 대부분인 사진에서는 알고리즘 차이가 수 dB에 불과해 보여도, 사람 눈은 가는 글자 가장자리의 지퍼 무늬와 옷감의 무지개 모아레를 매우 거슬리게 느낀다. 그래서 디모자이킹 평가는 PSNR과 함께 위색 지표, S-CIELAB ΔE, 시각 평가를 같이 쓴다.

에일리어싱과 광학 저역 필터(OLPF)

표본화 정리에 따르면 피치 \( p \)로 샘플링할 때 표현할 수 있는 최고 주파수는 나이퀴스트 주파수 \( f_N = 1/(2p) \)입니다. 이보다 높은 주파수 성분은 사라지지 않고 낮은 주파수로 접혀(aliasing) 원래 없던 무늬 — 모아레 — 를 만듭니다. 베이어 센서에서는 R·B의 샘플 피치가 \( 2p \)라서 \( 1/(4p) \) 이상의 성분부터 채널별로 다르게 접히고, 채널마다 접힌 무늬가 다르므로 회색 무늬가 무지개색 무늬로 나타납니다. 이것이 색 모아레(color moiré)입니다.

공간 주파수 f 장면 스펙트럼 R/B 복제 (1/(2p) 중심) G 복제 (1/p 중심) 1/(4p) : R/B 나이퀴스트 1/(2p) : G(가로) 나이퀴스트 0 겹침 → 접힌 성분
그림 4-5. 샘플링은 스펙트럼을 샘플링 주파수 간격으로 복제한다. R/B는 샘플 간격이 2p여서 복제본이 가까이 있고, 장면에 1/(4p)보다 높은 성분이 있으면 겹쳐서 색 모아레가 된다(개념도).

해결책은 샘플링 전에 고주파를 줄이는 것입니다. 샘플링 후에는 접힌 성분과 진짜 성분을 구별할 수 없기 때문입니다. 디지털 카메라의 광학 저역 필터(Optical Low-Pass Filter, OLPF / anti-aliasing filter)는 복굴절 결정(수정, 니오븀산 리튬) 판 두 장으로 한 점의 빛을 가로·세로로 \( d \)만큼 떨어진 4개의 점으로 나눕니다.

입사광 복굴절판 1가로 분리 o광 / e광 복굴절판 2세로 분리 d ≈ p 한 점 → 4점 (각 ¼)
그림 4-6. 복굴절 OLPF. 편광 성분(o광, e광)이 서로 다른 굴절률을 느껴 옆으로 밀린다. 수정의 분리량은 두께의 약 0.6% 수준이라, 4 µm 분리를 위해 약 0.7 mm 두께가 필요하다.

한 방향으로 \( d \)만큼 떨어진 두 점으로 나누는 것은 \( \tfrac12[\delta(x)+\delta(x-d)] \)와의 컨볼루션이고, 그 푸리에 변환의 크기가 곧 OLPF의 MTF입니다.

$$\mathrm{MTF}_{\mathrm{OLPF}}(f)=\left|\cos(\pi f d)\right|,\qquad \text{첫 영점 } f_0=\frac{1}{2d}$$
\( d=p \)이면 영점이 G 나이퀴스트 \( 1/(2p) \)에 놓인다. 대신 \( f=1/(4p) \)에서도 MTF가 0.71로 떨어져 영상이 눈에 띄게 부드러워진다.
SIMULATOR

OLPF 분리량과 모아레 · 선명도

관찰 영역
디모자이킹
위색 지수 OLPF 없음 → 있음—
MTF @ 1/(4p)—
MTF @ 1/(2p)—
왼쪽부터 원본, OLPF 없이 촬영·디모자이킹, OLPF를 거쳐 촬영·디모자이킹한 결과(같은 영역 확대). 아래 그래프는 OLPF의 MTF와 채널별 나이퀴스트 위치다. d를 0에서 1.5 px까지 움직이며 "모아레가 사라지는 d"와 "글자가 뭉개지기 시작하는 d"를 찾아보자.

최근 고화소 카메라와 스마트폰은 OLPF를 생략하는 경우가 많습니다. 픽셀이 매우 작아(0.6~1.2 µm) 렌즈의 회절과 수차 자체가 저역 필터 역할을 하고(5장), 비닝·리모자이크와 강력한 디모자이킹·위색 억제 처리가 모아레를 상당 부분 가려 주기 때문입니다. 반대로 픽셀이 크고 렌즈가 매우 선명한 풀프레임 카메라에서는 OLPF 유무가 여전히 설계 선택지입니다.

컬러 감도와 SNR 트레이드오프

베이어 필터는 픽셀마다 들어온 광자의 약 2/3를 흡수해 버립니다. W(투명)나 Y(노랑 = 빨강+초록) 필터는 훨씬 많은 광자를 통과시키므로 신호가 커지고, 7장에서 배울 샷 노이즈 한계 SNR \( \sqrt{S} \)도 올라갑니다. 그런데 공짜 점심은 없습니다. 넓은 대역의 필터는 "색을 구분하는 정보"가 적어서, 원하는 R·G·B를 얻으려면 채널들 사이의 큰 차이를 계산해야 하고, 차이 연산은 노이즈를 키웁니다.

$$\mathrm{SNR}_k=\frac{S_k}{\sqrt{S_k+\sigma_r^2}},\qquad \begin{bmatrix}R\\G\\B\end{bmatrix}_{\mathrm{out}} = M\,\mathbf{c},\qquad \sigma_{\mathrm{out},i}^2=\sum_j M_{ij}^2\,\sigma_j^2$$
\( S_k \): 채널 \(k\)의 신호 전자 수, \( \sigma_r \): 읽기 노이즈, \( M \): 색 보정 행렬(CCM). 예를 들어 RYYB에서는 \( G \approx Y-R \) 같은 뺄셈이 필요해 \( M \)의 계수가 커진다.

여기서 \( M \)은 각 CFA의 분광 감도를 CIE 기반 목표 감도(선형 sRGB)에 최소자승으로 맞춘 행렬 \( M = T S^\top (S S^\top)^{-1} \)입니다. 아래 시뮬레이터는 이 장의 분광 모델로 CFA별 \( M \)을 실제로 계산하고, 18% 회색 패치를 찍었을 때의 휘도 SNR과 색 SNR을 조도에 따라 비교합니다.

SIMULATOR

CFA별 휘도 SNR vs 색 SNR과 채널 신호 분포

CFA
최소자승 CCM (행: R,G,B 출력)
—
휘도 SNR (밝은 채널)—
색 SNR (CCM 후 평균)—
CCM 최대 |계수|—
색재현 잔차 (루터–아이브스)—
가정: 1.0 µm 픽셀, f/1.8, 1/30 s, 18% 회색 → 장면 1 lux당 픽셀 입사 광자 약 4.6개. 2×2 면적(4픽셀) 기준으로 같은 색 샘플을 평균한다고 보고 샘플 밀도를 반영했다. 그래프 실선 = 휘도 SNR(베이어는 G 중심 가중합, RYYB는 Y, RGBW는 W 채널 직접 사용), 점선 = CCM 적용 후 R·G·B 색 SNR 평균.

시뮬레이터에서 확인할 수 있는 결론은 이렇습니다. RYYB와 RGBW는 휘도 SNR에서 약 0.5~3 dB를 얻지만(RGBW가 가장 크다)(저조도 사진이 덜 거칠어 보임), 색을 복원하는 과정에서 큰 CCM 계수 때문에 색 SNR은 오히려 나빠지고 색재현 잔차도 달라집니다. 그래서 실제 제품은 휘도는 W/Y에서, 색은 넓은 영역에 걸친 강한 색 노이즈 저감으로 얻는 식으로 처리를 나눕니다. IR 컷을 끄면 신호는 늘지만 잔차와 CCM 계수가 급증하는 것도 확인해 보세요 — 감시 카메라가 주간 모드에서 IR 컷 필터를 기계적으로 끼우는 이유입니다.

실무 감각

채널 신호 분포 그래프에서 보듯 같은 회색이라도 채널별 전자 수는 다르다(베이어에서 대략 G > R ≳ B, 조명이 텅스텐이면 B가 훨씬 작다). 가장 약한 채널이 색 노이즈를 좌우하므로, 저조도 색 노이즈는 대개 파랑 채널에서 먼저 드러난다. 화이트 밸런스에서 B 게인이 크게 걸리는 실내 조명에서 파란 얼룩 노이즈가 흔한 이유다.

핵심 정리

  1. 포토다이오드는 광자 수만 세는 흑백 소자다. 색은 픽셀마다 얹은 컬러 필터(CFA)로 파장대를 골라 세고, 빠진 색은 디모자이킹으로 추정해 얻는다.
  2. 인간의 색은 세 원추 반응(또는 CIE \( \bar x\bar y\bar z \))으로 정해지는 3차원 양이다. 카메라 감도가 이들의 선형 결합이면(루터–아이브스 조건) 3×3 행렬로 정확한 색을 얻지만, 실제 필터는 근사일 뿐이다.
  3. 베이어 RGGB는 휘도에 가장 많이 기여하는 G를 50% 배치해 휘도 해상도를 확보한다. R·B는 나이퀴스트가 G의 절반이라 색 에일리어싱에 취약하다.
  4. 유효 분광 감도 = IR 컷 × 컬러 필터 × Si QE. 안료 필터는 근적외선에서 투명하므로 약 650 nm IR 컷이 없으면 색이 탁해진다.
  5. 쌍선형 보간은 지퍼·위색을 만들고, Hamilton–Adams(에지 방향 + 색차 보간)와 MHC(라플라시안 보정 5×5 선형 필터)는 채널 간 상관을 이용해 이를 크게 줄인다.
  6. OLPF는 샘플링 전에 고주파를 줄여 모아레를 막는다. MTF는 \( |\cos(\pi f d)| \)이며, 모아레 억제와 선명도는 맞바꾸는 관계다.
  7. RGBW·RYYB 같은 고감도 CFA는 휘도 SNR을 얻는 대신 CCM 계수가 커져 색 노이즈와 색재현에서 손해를 본다.

확인 퀴즈

베이어 패턴에서 G 픽셀이 R, B의 두 배인 가장 핵심적인 이유는?

휘도 \(Y = 0.2126R + 0.7152G + 0.0722B\)에서 G 가중치가 압도적이고, 사람 눈은 휘도의 공간 변화에 가장 예민하다. G를 체크무늬로 촘촘히 두면 휘도 해상도가 최대가 된다.

IR 컷 필터를 제거한 카메라로 낮에 촬영하면 주로 어떤 일이 생기는가?

안료 필터는 약 800 nm 위에서 세 색 모두 투명하고 실리콘은 1000 nm 근처까지 감도가 있다. 색 구분 없는 IR 신호가 세 채널에 더해져 채도가 떨어지고, CCM으로 되돌리려면 계수가 커져 노이즈가 늘어난다.

Hamilton–Adams 디모자이킹이 R 위치에서 G를 보간할 때 가로/세로 기울기 \( \Delta_H, \Delta_V \)를 비교하는 목적은?

기울기가 작은 방향이 에지를 따라가는 방향이다. 그 방향의 이웃만 평균하면 에지 양쪽 값이 섞이지 않는다. 여기에 R의 라플라시안 보정과 색차 보간을 더해 위색도 줄인다.

픽셀 피치 \(p\)인 베이어 센서 앞에 두 점 분리량 \(d = p\)인 복굴절 OLPF를 두었다. 가로 방향 MTF가 처음 0이 되는 공간 주파수는?

\( \mathrm{MTF}=|\cos(\pi f d)| \)는 \( \pi f d = \pi/2 \), 즉 \( f = 1/(2d) = 1/(2p) \)에서 처음 0이 된다. 이는 G의 가로 나이퀴스트와 같다. 1/(4p)에서는 cos(π/4) ≈ 0.71.

RYYB CFA가 베이어보다 저조도에서 유리하면서도 색 노이즈가 커지기 쉬운 이유로 가장 알맞은 것은?

노이즈는 \( \sigma_{out}^2=\sum_j M_{ij}^2\sigma_j^2 \)로 전파된다. 차이 연산은 큰 양·음 계수를 뜻하므로 채널 노이즈가 증폭된다. 감도(휘도)와 색재현(색 노이즈)은 트레이드오프 관계다.