검사실 연구 논문의 통계와 연구 방법론

서울의과학연구소 의학통계 강의

김진섭

2026-09-01

강의 흐름

연구 질문 → 분석 단위 → 통계 방법

QUESTION

핵심 질문

범위 · 차이 · 비율 · 군집 · 변화

UNIT

분석 단위

사람 · 검체 · 조직 · 분리 균주

EVIDENCE

결과 표현

분포 · 회귀 · 차이 · 비율 · 프로파일

개념 → 논문 Figure/Table → 해석

5개 논문

01 · RANGE

검사값의 정상 범위

PTH reference interval

KNHANES 2024 · PTH 측정 4,502명
주요 분석 155명 · Step 11 82명
Percentile · Bootstrap · Survey weighting

BMC Endocr Disord 2026;26:176
GC Labs

02 · AGREEMENT

두 검사법의 일치도

Triglyceride harmonization

동일 혈청 98쌍
Passing–Bablok · Bland–Altman · Bias

Ann Lab Med 2025;45:291-299
GC Labs

03 · PROPORTION

집락률·내성률 차이

GBS colonization

질 면봉 배양 33,721건
Proportion · Chi-square · Fisher’s exact

Yonsei Med J 2022;63:717-723
서울의과학연구소

04 · MULTIPLICITY

여러 미생물 동시 비교

CRC tissue microbiome

환자 38명 · 조직 39개
qPCR · Diversity · Relative abundance · FDR

Sci Rep 2020;10:19915
연세대학교

05 · PROFILE

계통·내성 조합의 시간 변화

GBS WGS

과거 37 vs 최근 209 균주
ST/CC · ARG · AMR profile

Ann Lab Med 2025 (alm.2025.0439)
서울의과학연구소

분석 단위 · 관찰 단위의 정의

개인 · 논문 1

PTH 검사값 · 주요 155명 / Step 11 82명

동일 혈청 검체 · 논문 2

두 검사법의 측정값 · 98쌍

배양 검체 · 논문 3

질 면봉 33,721건

조직 검체 · 논문 4

환자 38명 · 조직 39개

분리 균주 · 논문 5

37 vs 209 균주

사람 ≠ 검체 ≠ 균주 · 논문 4는 환자 38명에서 조직 39개 (한 환자에 병변 2개)

연구 질문 → 통계 방법

분포의 범위를 추정 · 논문 1

결과: 하한–상한

참고집단 선정 → 이상치 제거 → reference limits 추정 → reference limits의 CI

주 분석: survey-weighted quantile
N<120: robust method + bootstrap CI

동일 검체의 두 값을 비교 · 논문 2

결과: 회귀식 + 차이 + 기준값 대비 bias

Passing–Bablok → Bland–Altman → Harmonization

빈도와 비율을 비교 · 논문 3 · 5

결과: n/N (%) + P value

Chi-square 또는 Fisher’s exact test

고차원 결과 해석

논문 4 · Diversity · FDR

논문 5 · WGS · ARG · AMR profile

추정 대상 + 분모 확인 · P-value는 이후 해석

참고구간 · 검사값의 중앙 95%

01 · RANGE

개인 검사값의 분포 범위 · 2.5th–97.5th percentiles

참고구간의 끝점도 추정치 · 95% RI vs 90% CI

01 · 95% REFERENCE INTERVAL

95% reference interval (RI)

분포의 중앙 95%와 양쪽 2.5% 꼬리

모집단에서 개인 검사값의 중앙 95%가 위치하는 범위

[L, U] = [2.5th percentile, 97.5th percentile]  ·  P(L ≤ X ≤ U) = 0.95

모집단 전체는 알 수 없음 → 표본에서 L, U 추정

표본을 다시 뽑으면 L, U도 달라짐 → 하한·상한 각각에 추정의 불확실성 = confidence interval

02 · 95% RI ≠ 90% CI OF THE LIMITS

95% RI와 90% CI는 서로 다른 개념

의미
95% Reference Interval 개인 검사값의 95%가 어디에 분포하는가
90% CI of Lower Limit 진짜 2.5th percentile L이 어디에 있는가
90% CI of Upper Limit 진짜 97.5th percentile U가 어디에 있는가

예: Reference interval = 10.2 ~ 20.8

L = 10.2 (90% CI: 9.4 ~ 11.0)  ·  U = 20.8 (90% CI: 20.0 ~ 21.7)

95% = 개인 값의 분포 범위 · 90% = 그 끝점 추정의 정밀도

CLSI EP28-A3c

CLSI = Clinical and Laboratory Standards Institute · reference interval 설정·검증의 표준 가이드라인 · 표본 수에 따라 reference limit과 CI 산출법이 다름

N ≥ 120nonparametric order statistics
N < 120robust method + bootstrap

N ≥ 120 · 참고한계의 CI는 순위(order statistic)로

① 정렬

먼저 관측값을 작은 순서대로 정렬

X(1) ≤ X(2) ≤ ··· ≤ X(n)

X(k) = k번째로 작은 검사값 · 진짜 하한 L = 2.5th percentile · 한 사람이 L보다 작을 확률 P(X < L) = 0.025

② 이항분포

"L보다 작은 사람이 몇 명인가?"는 이항분포

K = 표본 n명 중 진짜 하한 L보다 작은 사람 수

120 × 0.025 = 3K ~ Binomial(120, 0.025)

각 관측치는 P(X < L) = 0.025인 시행이다. 따라서 진짜 L은 표본의 아래쪽 약 3번째 값 근처에 위치한다.

표본을 다시 뽑으면 K = 1, 5, 6 … 으로 변동 → 이 변동으로 L의 confidence interval 구성

K의 분포 · n = 120

K ~ Binomial(120, 0.025)

P(1 ≤ K ≤ 6) = 0.920 → 진짜 L이 1번째~7번째 값 사이일 확률 90% 이상 (다음 장) · P(K = 0) = 0.975120 = 0.048 = 아무도 L보다 작지 않을 확률

N ≥ 120 · r1, r2는 검사값이 아니라 순위(rank)

r1, r2는 검사값이 아니라 순위(rank)정렬된 관측값에서 참고한계 CI의 양 끝 위치를 지정한다.
③ 순위 선택

90% 이상이 되는 순위 선택

P( X(r1) ≤ L ≤ X(r2) ) ≥ 0.90

위 조건을 만족하도록 이항분포에서 r1, r2 선택 · n = 120: r1 = 1, r2 = 7

90% CI of L = X(1) ~ X(7)

1~7번째 값이 참고구간이라는 뜻이 아님 · 진짜 L이 1번째와 7번째 값 사이에 있을 확률이 90% 이상이라는 뜻

P(1 ≤ K ≤ 6) = 0.920 → P(X(1) ≤ L ≤ X(7)) = 92.0% · 이항분포는 정수 단위라 정확히 90%는 불가 → 90% 이상인 보수적 구간 사용

④ 상한

상한은 대칭으로 계산

U = 97.5th percentile에 같은 논리 적용 · n = 120:

90% CI of U = X(114) ~ X(120)

정렬된 120개 중 아래쪽 7개 = 하한 CI, 위쪽 7개 = 상한 CI

X(1) ··· X(7)    ······    X(114) ··· X(120)
N ≥ 120의 근거

비모수 참고구간의 최소 표본수

2.5th percentile은 분포의 끝 → 표본이 작으면 관측값이 거의 없음

  • n = 120에서 진짜 lower limit보다 작은 사람의 기대수 = 120 × 0.025 = 3명
  • 아무도 lower limit보다 작지 않을 확률 P(K = 0) = 0.9751200.048 (약 4.8%)

120명은 되어야 분포 가정 없이 관측값의 순위만으로 극단 percentile 추정 가능 → nonparametric RI 최소 120명의 실질적 이유

N < 120 · robust method + bootstrap

표본수 조건

N < 120

작은 표본에서는 단순 percentile법이 불안정하다.

예: n = 40 → 2.5th percentile의 위치

0.025 × (n + 1) = 0.025 × 41 ≈ 1.0

하한이 사실상 표본의 최솟값 하나로 결정

극단값 한두 개에 참고한계가 크게 변동

① ROBUST METHOD

Robust method = limits 추정

Horn & Pesce의 robust method

  • 중심부 데이터에 큰 가중치
  • 극단값의 영향 축소
  • 중심(location)·산포(scale)를 반복 추정

추정된 중심·산포로 L, U 계산

극단 percentile을 직접 읽지 않고 전체 데이터 정보 활용

② BOOTSTRAP

Bootstrap = limits의 CI 추정

robust로 얻은 L, U도 표본에 따라 달라짐 → 원 표본에서 복원추출로 같은 크기의 bootstrap 표본 생성 → 표본마다 L*, U* 재계산

전체 흐름 · 참고구간과 참고한계의 CI

Population모집단
95% RI[2.5th, 97.5th percentile]
표본으로 추정L, U
표본추출 변동성다시 뽑으면 L, U가 달라짐
참고한계의 CI90% CI(L), 90% CI(U)
N ≥ 120→ order statistics + binomial distribution: 정렬된 관측값의 순위 r1~r2로 CI
N < 120→ robust method로 limits 추정 → bootstrap으로 limits의 CI 추정

Reference interval = 개인 검사값의 분포 · CI of the reference limits = 그 끝점 추정의 확실성 → 다음: R 코드로 실제 계산

참고한계 CI 추정 · R 코드와 논문 1 결과

N ≥ 120 · 복합표본 (논문 1 주 분석)

Survey-weighted quantile + CI

Woodruff 방식: 누적비율 p(0.025, 0.975)의 CI = p ± 1.645·SE → x축 값으로 역변환 · 위쪽 꼬리에서 CI가 최대 관측값을 넘으면 상단 CI 없음 (논문 Figure 1 Step 6~8과 같은 현상)

library(survey)
des <- svydesign(id = ~psu, strata = ~kstrata,
  weights = ~wt_itvex, data = dd, nest = TRUE)
svyquantile(~PTH, des, quantiles = c(0.025, 0.975),
  ci = TRUE, alpha = 0.10)   # 90% CI
#       quantile ci.5 ci.95
# 0.025     22.7 21.6  23.4
# 0.975     75.5 63.3   NaN   ← 상단 CI 없음

모의자료(n=155) 출력 · psu, kstrata, wt_itvex는 KNHANES 변수명

N < 120 · 소표본

Robust method + bootstrap CI

Horn & Pesce robust method로 하한·상한 → 복원추출로 재계산 수천 번 → 그 분포의 5th~95th percentile = 90% CI

library(referenceIntervals)
refLimit(x, RI = "r", CI = "boot", bootStat = "perc",
  refConf = 0.95, limitConf = 0.90)   # 한계 CI 90%
# Reference Interval:        12.5, 64.5
# Lower Confidence Interval:  8.0, 17.6
# Upper Confidence Interval: 59.1, 69.6

## 직접 계산하면: 복원추출 → 한계 재계산 → 5th~95th
b   <- replicate(2000, sample(x, replace = TRUE))
lim <- apply(b, 2, robust)
apply(lim, 1, quantile, c(0.05, 0.95))

모의자료(n=82) 출력 · 직접 계산도 8.1–17.5 / 59.1–69.5로 동일

논문 1 실제 결과 · Figure 1, 이상치 제거 후 · 가중

Step 8 · n=155 (N ≥ 120) · survey-weighted quantile CI 하한 20.5 (18.8–22.8) · 상한 67.7 (62.4–upper unavailable)
Step 9 · n=82 (N < 120) · robust method + bootstrap 하한 21.5 (20.0–23.3) · 상한 58.0 (53.1–62.8)

논문 1 · PTH 참고집단의 단계별 선정 흐름

PAPER 1 · PTH · BMC Endocr Disord 2026

남은 PTH 측정자 수 · 주요 milestone만 표시

PTH 참고집단 단계별 selection funnel PTH 측정자 4,502명에서 만성질환, 건강보조제, 비만, eGFR, Vitamin D, ALP 기준을 적용해 82명까지 줄어드는 흐름 4,502 PTH 측정자 861 만성질환 제외 288 보충제 제외 ⋯ Step 3–5 · 임신 · 부정맥 · 고혈압 제외 ⋯ 165 Step 6 · 비만까지 제외 ⋯ Step 7 · 당뇨 제외 ⋯ 159 Step 8 · eGFR ≥60 적용 84 Step 9 · Vitamin D ≥20 ng/mL Step 10 · Ca/Mg/P 정상 → 83명 82 Step 11 · ALP 정상

분석 흐름도 · 원 논문 Table 1의 단계별 PTH 측정자 수를 재구성

MAIN REFERENCE POPULATION

N = 155

Step 8 집단에서
이상치 제거 후 복합표본 분석에 포함

20.5–67.7 pg/mL

논문 초록·본문의 주요 가중 참고구간

STRICTEST STEP

82명

Vitamin D·Ca/Mg/P·ALP까지 적용

가중·이상치 제거 후 N=80

N < 120

생물학적으로 가장 엄격하지만 참고한계 추정의 정밀도는 낮음

선정 기준 강화에 따라 참고집단 N이 감소하며, 소표본 단계에서는 참고한계 추정의 불확실성이 증가한다.

Choi R, et al. BMC Endocr Disord. 2026;26:176 · Table 1–2

논문 1 · PTH 참고구간 분석 절차

PAPER 1 · PTH · BMC Endocr Disord 2026

Choi R, et al. BMC Endocr Disord. 2026;26:176 · Methods / Table 1–3

논문 1 · Table 1: 단계별 참고집단 선정 결과

PAPER 1 · PTH · BMC Endocr Disord 2026

Table 1 발췌·강조: 단계별 선정 기준과 PTH 측정자 수, Step 0과 Step 11, 표본 감소가 큰 Step 1, Step 2, Step 6, Step 9를 표시한 표
Table 1 발췌·강조 · 단계별 선정 기준과 PTH 측정자 수
Choi R, et al. BMC Endocr Disord. 2026;26:176 · Table 1
KEY VARIABLE
주요 확인 항목

N of subjects with
PTH measurement

Residual subjects ≠ 실제 PTH 분석 N
참고구간은 PTH measurement 열을 기준으로 읽는다.

1
만성질환 제외

4,502 → 861

−3,641명 가장 큰 감소
2
보충제 사용 제외

861 → 288

−573명 두 번째로 큰 감소
3
비만 제외

235 → 165

−70명 Step 6
4
Vitamin D ≥20 ng/mL

159 → 84

−75명 여기서 N<120
N < 120 시작 Step 9–11 · 84 → 83 → 82명

질환·보충제 제외 단계에서 표본 감소가 가장 크며, Vitamin D 기준 적용 이후 n<120

논문 1 · Table 2: 전처리 전후 PTH 분포 변화

PAPER 1 · PTH · BMC Endocr Disord 2026

이상치 제거 + 복합표본 가중 적용 전후의 PTH 분포 비교

Table 2 발췌·강조: Step 0 PTH의 무가중 이상치 제거 전과 가중 이상치 제거 후 N, 평균, 표준편차, 중앙값, 사분위범위, 2.5th–97.5th percentile, Min–Max 비교
Table 2 발췌·강조 · Step 0의 PTH 분포Choi R, et al. BMC Endocr Disord. 2026;26:176 · Table 2
EDUCATIONAL EXAMPLE

MAD 기반 이상치 판정

중앙값 303234 353638 이상치 후보 150

중앙값에서 ±3.5 MAD보다 멀리 떨어진
PTH 값만 이상치로 제외

실제 논문은 PTH 값에만 이 규칙을 적용
분석 N: 4,502 → 4,408 단위: pg/mL ● 전·무가중● 후·가중
평균39.237.8조금 감소
중앙값36.436.0변화 미미
참고구간18.7–74.619.1–66.1상한 감소74.6 → 66.1
Min–Max5.4–352.05.4–77.2변화 폭 최대

평균과 중앙값의 변화는 작았으나, 참고상한과 극단값은 상대적으로 크게 감소했다. 이상치 제거는 분포의 상위 꼬리에 주로 영향을 미친다.

Choi R, et al. BMC Endocr Disord. 2026;26:176 · Table 2 · 단위 주: 원문 Table 제목의 ng/mL 표기는 본문·초록 및 수치 규모상 pg/mL로 해석

논문 1 · Table 3: 최종 PTH 참고구간 비교

PAPER 1 · PTH · BMC Endocr Disord 2026

Table 3 발췌·강조: 제조사 PTH 참고구간 16.0–65.0 pg/mL, 본 연구 주요 분석집단 N=155의 20.5–67.7 pg/mL, 엄격한 하위집단 N=82와 N=81의 참고구간 비교
Table 3 발췌·강조 · 제조사 기준과 본 연구의 주요/엄격 기준 비교Choi R, et al. · Table 3※ 원문 Table 3 제목의 ng/mL 표기는 본문·초록·수치와 불일치하며, 본 강의에서는 pg/mL로 해석함.
MANUFACTURER

기기 설명서 기준

N: N/A 16.0–65.0 pg/mL

제조사 기기 설명서 기반 참고구간

MAIN RESULT

This study · N=155

eGFR ≥60 · 25(OH)D 조건과 무관

20.5–67.7 pg/mL

본문에서 대표로 사용하는 주요 참고구간

STRICTER SUBGROUP

강화된 건강인 기준

N=8221.5–58.0
N=8121.4–58.2

Vitamin D·Ca·Mg·P·ALP 조건까지 적용
상한은 낮아지지만 표본이 작아 정밀도는 떨어짐

기준 강화 → 상한 ↓ · N 155 → 82/81

본 논문의 대표 PTH 참고구간은 N=155 기반 20.5–67.7 pg/mL이다. 강화된 기준에서는 상한이 58 pg/mL 수준으로 낮아지지만, 대표 참고구간으로 적용하기에는 표본 규모가 제한적이다.

Manufacturer보다 주요 참고구간의 하한·상한이 모두 약간 높다 · 엄격 하위집단은 기준 강화에 따른 변화를 보여주는 보조 근거Choi R, et al. BMC Endocr Disord. 2026;26:176 · Table 3

논문 1 · Figure 1: 선정 기준에 따른 PTH 참고구간 변화

PAPER 1 · PTH · BMC Endocr Disord 2026

건강인 기준 강화에 따른 참고하한·참고상한 변화

원 논문 Figure 1 발췌: Step 0–11의 PTH 2.5th 및 97.5th percentile과 이상치 제거·복합표본 가중 전후 결과 97.5th
참고상한
2.5th
참고하한
Step 9
Vitamin D ≥20
Figure 1. Step별 PTH 참고하한·참고상한 및 가중 전후 비교 원 논문 표식: 주황/빨강 = 무가중·이상치 제거 전 · 파랑 = 가중·이상치 제거 후 큰 반투명 영역은 발표용 강조 표시
LOWER LIMIT
참고하한
약 20 pg/mL

대부분의 Step에서 2.5th percentile은 비교적 안정

Step 8: 20.5 · Step 9: 20.5
UPPER LIMIT
참고상한
상한 추정의 변동성

97.5th percentile은 건강인 기준·가중치·표본 수에 더 민감

Step 8: 67.7 → Step 9: 62.4 pg/mL Table 2 · weighted, after outlier exclusion
BIOLOGICAL FILTER
Vitamin D 기준

Step 9에서 25(OH)D ≥20 ng/mL 적용

PTH 측정자 159 → 84명 표본 감소와 참고상한 하향 변화
UPPER LIMIT VARIABILITY

복합표본의 97.5th percentile은 소수의 큰 survey weight 관찰값에 민감하다.

논문에서도 Step 6–8 일부 upper 90% CI가 불안정해 표시되지 않았다.
이를 생물학적 변화라고 단정할 수 없다.

참고하한은 비교적 안정적이지만, 참고상한은 건강인 기준과 복합표본 구조에 더 민감하다. 선정 기준 강화 → 참고구간 축소 · 표본 감소 → 정밀도 저하

Choi R, et al. BMC Endocr Disord. 2026;26:176 · Figure 1 / Table 2

검사법 비교 · Correlation ≠ Agreement

02 · AGREEMENT

Paired data · 관계 / 차이 / 변환 가능성

논문 2 · Table 1: 2022년 TG 측정법 변경

PAPER 2 · TRIGLYCERIDE · Ann Lab Med 2025

Table 1 발췌: KNHANES 중성지방 측정법의 2018–2021과 2022 이후 차이, glycerol blanking 유무와 검사실·분석기·시약·free glycerol 처리 비교
Table 1 발췌 · 2018–2021 vs Since 2022 측정법 비교
KEY VARIABLE

주요 확인 항목

1Year
비교 시기 구분
2Measurement principle
glycerol blanking 유무
3Laboratory · Analyzer · Reagent kit
실제 측정 환경 변화
4Free glycerol treatment
과거에는 제거 · 2022부터 포함
핵심 변화 1

2018–2021

Enzymatic
with glycerol blanking 방식

핵심 변화 2

Since 2022

Direct enzymatic
without glycerol blanking 방식

INTERPRETATION

측정법이 달라지면 값도 달라질 수 있다

같은 중성지방이라도 분석법 변화로 체계적 차이가 생길 수 있어, 시계열 비교에는 보정식이 필요하다.

특히 glycerol blanking 유무의 변화가 이 논문의 핵심 출발점이다.

2022년부터 중성지방 측정법이 바뀌었기 때문에, 이전 연도와 직접 비교하려면 보정식이 필요하다.

Choi R, et al. Ann Lab Med. 2025;45:291–299 · Table 1

논문 2 · 아산 paired 검체로 식을 만들고 국건영에 적용

PAPER 2 · TRIGLYCERIDE · Ann Lab Med 2025

① 식 만들기 · 서울아산병원 PAIRED 검체 98쌍

같은 혈청을 둘로 나눠 두 검사법으로 측정

  • 2022-01-06 외래·검진 잔여 혈청 98개 (9–885 mg/dL), 국건영 참여자 아님
  • aliquot 2개 → Seegene(glycerol blanking, X) · GC Labs(non-blanking, Y) 동시 측정
Passing–Bablok: Y = 11.94 + 0.99 X

기울기 ≈ 1, 절편 +11.9 → non-blanking이 일정하게 +10.7 mg/dL (10%) 높음

식을 적용
② 적용 · 국건영 2019–2021

과거 TG 값을 2022 척도로 변환

  • 참여자 n = 16,015 (비임신 · 공복 ≥ 12 h · 10세 이상)
  • 평균 123.7 → 134.3 mg/dL
  • ≥ 200 mg/dL 유병률 11.9% → 13.8% (비가중 예시)
  • survey 설계(psu·strata·weight) 미반영 → 논문이 "example analysis"로 명시, 대표 유병률 아님 (논문 1과 대비)

국건영은 매년 다른 사람 → 사람으로는 검사법 차이 측정 불가 → 검사법 차이는 같은 검체에서, 과거 자료는 척도만 변환

검사법 차이는 아산 검체 98쌍에서, 적용은 국건영 자료.

Correlation ≠ Agreement

CORRELATION

r = 0.997

두 측정값이 함께 증가하는 정도

AVERAGE DIFFERENCE

+10.7 mg/dL

Non-blanking이 평균적으로 더 높음

두 값이 높은 상관관계를 보여도

평균 +10.7 mg/dL 차이 → 체계적 불일치

Correlation = 관계 · Bland–Altman = 차이

Passing–Bablok과 Bland–Altman · 실선과 점선의 뜻

핵심 개념 · PASSING–BABLOK

같은 검체의 두 측정값 관계: Y = a + bX

Passing–Bablok 회귀분석 개념도
  • 회색 점선 Y = X: 두 검사법이 완전히 같을 때의 선 (line of identity)
  • 빨간 실선: Passing–Bablok 회귀선. 절편 a ≠ 0 → constant bias, 기울기 b ≠ 1 → proportional bias
  • 판단은 95% CI로: 논문 2는 기울기 CI 0.977–1.013(1 포함), 절편 CI 9.50–14.76(0 불포함) → 일정한 양의 차이만
핵심 개념 · BLAND–ALTMAN

같은 검체의 두 측정값 차이를 직접 표시

  • x축 = 두 방법의 평균, y축 = 차이(Y − X). 파란 실선 = 평균 차이(bias), 회색선 = 0
  • 점선 = bias ± 1.96 SD (limits of agreement): 개별 검체 차이의 약 95%가 이 안
  • 논문 2 Figure 2의 점선 = 평균 차이의 95% CI (bias 추정의 정밀도, LoA 아님) · Figure 4의 점선 = ±5% 허용 bias 한계

Passing–Bablok은 관계의 bias를, Bland–Altman은 차이의 분포를 평가한다.

Passing–Bablok vs OLS

같은 진짜 관계 · X 오차 유무에 따른 두 상황 (모의자료)

같은 진짜 관계, X 오차의 유무에 따른 OLS와 PB

① 오차가 어디에 있나

OLS는 X에 오차가 없다고 가정한다

검사법 비교는 X도 검사값 → 양쪽 다 오차 · X 오차 시 OLS 기울기 = β × Var(T)/(Var(T)+σ²ₓ) < β (축소), 절편은 증가 → "비례 오차 있음"이라는 잘못된 결론 가능

② 대칭성

어느 쪽을 X로 두든 같은 관계여야 한다

OLS: Y~X와 X~Y가 다른 직선 · Passing–Bablok: 축을 바꾸면 정확히 역함수

③ 추정 원리

최소제곱이 아니라 pairwise slope의 shifted median

OLS = 잔차² 합 최소화 · PB = 모든 두 점의 기울기의 shifted median = 기울기, median(Y − βX) = 절편 → 다음 두 장

참고 · Deming 회귀: 양쪽 오차를 정규분포로 가정한 최소제곱 · 오차분산비 λ 필요, λ = 1이면 직교회귀 · 대칭성은 PB와 동일, 가정이 맞으면 CI가 더 좁음 (27p 표)

Passing–Bablok 기울기의 shifted median

핵심 개념

기울기 추정의 세 단계

① 모든 두 점의 기울기
Sij = (Yj − Yi) / (Xj − Xi), i < j
관측치 n개 → 최대 n(n−1)/2개

② 정렬하고 shifted median
Sij = −1은 제외 · K = #(Sij < −1)
median의 순위 위치를 K칸 오른쪽으로 이동 (값에 K를 더하는 것이 아님)

③ 절편
기울기 확정 후 α = median(YiβXi) (보통의 median)

직관적 예시 · 정렬된 pairwise slope 9개 (N = 9)

보통의 median은 5번째, Passing–Bablok은 5 + K = 7번째

−3−2−0.50.81.01.11.31.51.8
123456789
S < −1 → K = 2 보통의 median
5번째 = 1.0
K = 2칸 → shifted median
7번째 = 1.3 → 기울기
N 홀수: β = S((N+1)/2 + K) N 짝수: β = [ S(N/2 + K) + S(N/2 + 1 + K) ] / 2

Theil–Sen = pairwise slope의 median · Passing–Bablok = pairwise slope의 shifted median (shift 크기 K = #(S < −1)) · 절편 = 보통의 median

Passing–Bablok 기울기는 pairwise slope를 정렬한 뒤 K만큼 이동한 중앙값으로 추정한다.

Passing–Bablok의 −1 경계값: 기하학적 의미

기하학적 직관 · 방향(각도)

slope = tan θ · 이상적 관계 slope 1 = 45°

수식 해석 · S < −1의 순위 이동

같은 직선, 각도 표기만 변경

slope −2 = θ −63.4° · 직선은 180° 회전해도 같은 직선 → −63.4° + 180° = 116.6° → 45° 중심 범위의 오른쪽 끝

숫자로 정렬하면

−3−2|−0.50.81.01.11.31.51.8

↑ K = 2개가 맨 왼쪽 · | = slope −1 경계

방향(각도)으로 정렬하면

−0.50.81.01.11.31.51.8|−3−2

↑ 같은 K = 2개가 맨 오른쪽으로 wrap-around → median 순위도 K칸 오른쪽

−1 자체에 통계적 의미는 없음. slope 1(45°)을 중심에 두고 직선 방향을 −45° < θ < 135°로 대칭이 되게 펼칠 때의 경계값 −45°를 slope로 쓴 것이 −1. 경계 위의 S = −1은 제외. R: mcr::mcreg(method.reg = "PaBa") 기본값 slope.measure = "radian" = 각도 기준 median

비교표 · 시뮬레이션 · R 코드 (Deming은 참고)

핵심 개념 · 세 회귀의 가정
OLS Deming Passing–Bablok
오차 Y만 (X 고정) X·Y 둘 다 · 정규 · 분산비 λ 지정 X·Y 둘 다 · 분포 무관
적합 기준 수직 잔차² 합 최소 λ로 가중한 직교 거리² 합 최소 점 쌍 기울기의 중앙값
이상치 민감 민감 robust
CI t 분포 jackknife · bootstrap 순위 기반 · bootstrap
주의 X 오차 시 기울기 축소 비례 오차면 weighted Deming 선형성 전제 (cusum), 원법은 오차분산비 = b²

선택 기준: X가 기준법(오차 무시 가능)이면 OLS 가능 · 둘 다 검사법이면 Deming(정규·λ 알 때) 또는 PB(분포 미상·이상치) = CLSI EP09 관례 · r ≈ 1이면 셋이 거의 동일 (논문 2: r = 0.997)

수치 예시와 코드 · 진짜 관계 Y = 10 + 1.0·X, n = 98

오차가 커지면 OLS 기울기는 1에서 멀어지고 PB는 1 근처 유지

오차 SD r OLS Y~X OLS X~Y⁻¹ PB
2 1.000 1.000 1.001 1.000
20 0.951 0.956 1.056 1.008
50 0.753 0.772 1.360 1.050
library(mcr)
fit <- mcreg(x, y, method.reg = "PaBa",
  method.ci = "bootstrap")     # Passing–Bablok
getCoefficients(fit)
#             EST    LCI    UCI
# Intercept 7.225 -4.163 24.816
# Slope     1.008  0.929  1.078
mcreg(x, y, method.reg = "Deming")  # Deming
coef(lm(y ~ x))        # OLS: 17.69, 0.956
plot(fit); plotDifference(fit)  # 회귀·B–A

모의자료(오차 SD 20) 출력 · 표는 같은 설정을 오차 SD별로 반복

논문 2 · Figure 2: 측정법 간 관계와 차이

PAPER 2 · TRIGLYCERIDE · Ann Lab Med 2025

Figure 2 전체 A, B, C: Passing–Bablok 관계 분석, mg/dL 단위 Bland–Altman 절대 차이, 퍼센트 단위 Bland–Altman 차이
Figure 2. 측정법 비교 · A 관계 / B 절대 차이 / C 퍼센트 차이GC Labs non-blanking 측정값과 Seegene glycerol blanking 측정값 비교 · 파란 실선 = 평균 차이, 점선 = 그 95% CI (limits of agreement 아님)
A · RELATIONSHIP

Passing–Bablok

r = 0.997 Y = 11.94 + 0.99X

두 방법은 매우 높은 상관관계를 보이지만, 측정값의 일치를 의미하지 않음

Slope 95% CI
0.977–1.013 → 1 포함
Intercept 95% CI
9.50–14.76 → 0 불포함
비례 차이는 작고 · 일정한 양의 차이가 남음
B · ABSOLUTE DIFFERENCE

Bland–Altman · mg/dL

+10.7 mg/dL95% CI
8.9–12.6 mg/dL

새 non-blanking 방식이 평균적으로 더 높음 · 대부분의 점이 0선 위

C · PERCENT DIFFERENCE

Bland–Altman · %

+10.0%95% CI
8.3–11.7%

낮은 TG에서는 같은 절대 차이가 더 큰 퍼센트 차이로 보임

150 mg/dL
약 +6.9%
200 mg/dL
약 +5.0%
500 mg/dL
약 +1.4%

높은 상관관계는 두 측정값의 일치를 의미하지 않는다. 회귀식은 변환 관계를, Bland–Altman은 실제 차이를 제시한다.

Choi R, et al. Ann Lab Med. 2025;45:291–299 · Figure 2

논문 2 · Figure 3: TG 보정 전후 분포와 유병률 변화

PAPER 2 · TRIGLYCERIDE · Ann Lab Med 2025

Figure 3 density plot: 파란색 2019–2021 원자료, 초록색 2022 원자료, 빨간색 2019–2021 보정 후 자료, 회색 점선 200 mg/dL 기준
2019–2021 원자료 2022 원자료 2019–2021 보정 후 200 mg/dL 기준
분포 변화

보정 후 오른쪽 이동

빨간선이 파란선보다 전체적으로 오른쪽으로 이동

같은 과거 사람들의 TG가 새 측정척도에서는 더 높게 표현됨

MEAN TG 123.7 → 134.3 mg/dL +10.6 mg/dL

2019–2021 N=16,015에 보정식 적용

HYPERTRIGLYCERIDEMIA 11.9% → 13.8% ≥200 mg/dL · +1.9 percentage points
예시용 비가중(unweighted) 분석
INTERPRETATION

빨간선과 초록선의 해석

2019–2021과 2022는 서로 다른 연도·다른 참여자

보정 목적은 두 집단을 같게 만드는 것이 아니라 측정 척도를 맞추는 것

측정 척도를 바꾸면 같은 과거 자료에서도 평균 TG와 ≥200 mg/dL 비율이 함께 증가한다.검사법 변화는 개인 수치뿐 아니라 역학 통계에도 영향을 준다.

Choi R, et al. Ann Lab Med. 2025;45:291–299 · Figure 3

Bias · 기준값 대비 측정 차이 평가

1 · DIFFERENCE

두 검사법의 차이

검사법 B − 검사법 A

Bland–Altman으로 두 방법 사이의 실제 차이와 범위를 평가

2 · BIAS

기준값 대비 차이

검사값 − 기준값

기준값도 측정값: 같은 물질을 기준측정법(RMP)으로 잰 값 · 검사값 = 같은 물질을 일상 검사법으로 잰 값 → 방법이 다른 두 측정값의 차이

3 · PERCENT BIAS

기준값 대비 백분율

(검사값 − 기준값)
÷ 기준값 × 100

측정 수준이 달라도 상대적인 벗어남을 같은 척도로 비교

Difference와 Bias는 기준이 다르다

Bland–Altman은 두 검사법 사이의 차이를 평가하고,
bias 분석은 각 검사법이 기준값에서 얼마나 벗어났는지를 평가한다.

기준값의 위계: 기준측정법(RMP, 예: CDC IDMS) 배정값 → 인증표준물질(CRM) 인증값 → 외부정도관리 참여기관 평균(동료 일치, 진도 아님) → 비교검사법과의 차이(Figure 2)는 bias가 아니라 difference

Allowable bias ±5%
−5%0+5%
0%에 가까울수록 기준값과 가까움

Bland–Altman = 두 일상 검사법 사이의 차이 · Bias = 같은 물질을 기준측정법으로 잰 값과의 차이 (기준값도 측정값, 방법만 다름)

논문 2 · Figure 4: CDC 기준 대비 TG 측정 Bias 변화

PAPER 2 · TRIGLYCERIDE · Ann Lab Med 2025

Figure 4: 2018–2021 glycerol blanking과 2022 non-blanking 중성지방 측정값의 CDC LSP target 대비 percent bias, 0% target과 ±5% 허용한계 2018–2021 · blanking 2022 · non-blanking
0% = CDC target+5% / −5% = allowable bias limits
INTERPRETATION

Bias

(검사값 − CDC target) ÷ CDC target × 100

0%에 가까울수록 CDC target과 가까움
±5% 안 = 허용 범위

2018–2021

Glycerol blanking

주로 음의 Bias
대부분 0% 아래여러 측정값이 −5% 기준 밖CDC target보다 낮게 측정되는 방향
CDC target은 total glyceride · non-blanking 기준
SINCE 2022

Non-blanking

±5% 이내
2022 결과는 CDC LSP 허용범위 안측정 원리가 CDC 기준과 일치하도록 정렬됨

2018–2021의 음의 bias는 측정 척도 차이와 관련되고, 2022 non-blanking 전환 후 CDC 기준과의 comparability가 개선됐다.

Choi R, et al. Ann Lab Med. 2025;45:291–299 · Figure 4

비율 비교 · 분모의 정의

03 · PROPORTION

집락률 / 내성률 / MDR · 분모 각각 확인

논문 3 · 집락률·내성률·MDR의 분모

PAPER 3 · GBS COLONIZATION · Yonsei Med J 2022

집락률
임산부 검체에서 GBS가 얼마나 검출됐는가
GBS 양성 배양 검체 ÷ 전체 질 면봉 배양 검체3,578 / 33,721 = 10.6%
항생제 내성률
각 항생제마다 검사 가능한 균주 수가 다를 수 있음
특정 항생제에 R인 GBS 균주R인 균주 / 해당 약 검사 N해당 항생제 감수성검사를 받은 균주
1전체 배양 검체33,721건
2GBS 양성3,578건10.6%
3감수성검사3,512균주
chloramphenicol 검사 시행 균주만2018년 미검사 · 2019–2020 일부
5개 약 결과 완비 → MDR 평가
4MDR 분석 하위집단1,672균주chloramphenicol 검사 균주
5MDR538균주32.2%
COLONIZATION
3,578 / 33,721집락률 10.6%
SUSCEPTIBILITY
각 약의 R / 해당 약 검사 N항생제별 내성률
MDR
538 / 1,67232.2%

동일 논문에서도 분석 결과에 따라 분모가 달라진다. 비율 해석 전 분모(N)를 확인한다.

Bae HG, et al. Yonsei Med J. 2022;63:717–723

논문 3 · 2018–2020년 전국 GBS 집락률

PAPER 3 · GBS COLONIZATION · Yonsei Med J 2022

2018
0–12% scale
10.8%1,184 / 10,956
2019
0–12% scale
10.5%1,181 / 11,211
2020
0–12% scale
10.5%1,213 / 11,554
최대 차이 = 0.3%p큰 연도 변화 없음
STATISTICAL TEST

Chi-square test

연도별 GBS 양성/음성 비율을 비교

논문 결과 · 연도별 집락률 차이 없음

전국 GBS 집락률은 2018–2020년 10.5–10.8%로 거의 일정했다.10.8% → 10.5%를 의미 있는 감소 추세로 해석하지 않는다.

Bae HG, et al. Yonsei Med J. 2022;63:717–723 · Table 1

논문 3 · Figure 1: 지역별 GBS 집락률 분포

PAPER 3 · GBS COLONIZATION · Yonsei Med J 2022

Figure 1. 검체가 30개를 초과한 지역 도시들의 GBS 집락률을 점 크기로 나타낸 지도
Figure 1 · 검체 수가 30개를 초과한 지역 도시의 GBS 집락률
REGIONAL RANKING

3년 전체 지역 subtotal

전국 10.6%
전라도HIGHEST13.2%
강원도12.0%
충청도11.8%
경기도11.3%
서울10.2%
경상도LOWEST9.6%
REGIONAL RANGE13.2% ↔ 9.6%차이 3.6%p
CHI-SQUARE BY REGION · 각 연도 내 지역 비교
2018
강원·전라 높음 · p<0.01
2019
서울·경상 낮음 · p<0.01
2020
유의한 지역 차이 없음 · p>0.05
INTERPRETATION NOTE

지역 차이는 검체 구성·의뢰기관·검사 규모와 함께 해석해야 한다.
후향적 검사실 자료만으로 지역 자체를 원인이라 할 수 없다.

전국 평균은 10.6%였지만, 지역별 집락률은 9.6–13.2% 범위였다.지역별 집락률 해석 시 지역별 표본 규모를 함께 고려한다.

Bae HG, et al. Yonsei Med J. 2022;63:717–723 · Figure 1 / Table 1

논문 3 · Table 3: 항균제별 내성률

PAPER 3 · GBS COLONIZATION · Yonsei Med J 2022

RESISTANCE RATE · COMMON SCALE 0–60%
0%20%40%60%
Tetracycline Resistance ≈50%50.0–53.3%
2018 50.4 · 2019 50.0 · 2020 53.3
Erythromycin Resistance ≈35%35.6–36.8%
2018 36.6 · 2019 35.6 · 2020 36.8
Clindamycin Resistance ≈35%33.4–35.7%
2018 34.3 · 2019 33.4 · 2020 35.7
Levofloxacin Resistance ≈20%18.2–19.6%
2018 18.2 · 2019 18.5 · 2020 19.6
Chloramphenicol 약 3% R2.6–2.7%
2018 ND · 2019 2.7 · 2020 2.6
100% SUSCEPTIBLE

내성 발견 없음

PenicillinAmpicillinVancomycinCeftriaxoneCefotaximeCefepimeMeropenem

본 연구의 GBS isolate는 위 항생제에 모두 감수성

YEAR TREND

내성 수준과 시간 추세의 구분

2018–2020년 내성률 차이의 p-value는 모두 0.05보다 컸다.

Chloramphenicol p=0.753Levofloxacin p=0.659Clindamycin p=0.593Erythromycin p=0.876Tetracycline p=0.301
내성률은 높았지만 3년간 뚜렷한 증가·감소 증거는 없음
INTERPRETATIONClindamycin · 33.4–35.7% R

Penicillin을 사용할 수 없는 경우, 대체약 선택 시 감수성 결과 확인이 중요

Penicillin계는 감수성이 유지됐지만, clindamycin·erythromycin은 약 1/3, tetracycline은 약 절반에서 내성이었다.내성 수준이 높다는 것과 시간이 지나며 증가했다는 것은 서로 다른 해석이다.

Bae HG, et al. Yonsei Med J. 2022;63:717–723 · Table 3

논문 3 · Table 2: MDR 내성 조합

PAPER 3 · GBS COLONIZATION · Yonsei Med J 2022

Table 2. 1,672개 GBS isolate 중 538개 MDR isolate의 5개 비β-lactam 항생제 내성 조합
Table 2 · 538개 MDR GBS isolate의 resistance pattern
KEY VARIABLE

열 순서 · Chloramphenicol → Levofloxacin → Clindamycin → Erythromycin → Tetracycline
S susceptible · R resistant · I intermediate · S-S-R-R-R = 앞의 두 약에는 감수성, 뒤의 세 약에는 내성

MDR DEFINITION

3개 이상 항생제 계열에 내성

538 / 1,67232.2%

분모는 전체 AST 3,512균주가 아니라, 5개 비β-lactam 약 결과를 함께 평가할 수 있었던 1,672균주

PRIMARY RESISTANCE PATTERNS · S · R · R · RCHL · LVX · CLI · ERY · TET
364 / 53867.7%

주요 MDR resistance pattern · Clindamycin + Erythromycin + Tetracycline 동시 내성

SECONDARY RESISTANCE PATTERNS · R · R · R · R
110 / 53820.4%

Levofloxacin까지 포함한 4개 약 동시 내성

PATTERN SHARE
S-S-R-R-R364 · 67.7%
S-R-R-R-R110 · 20.4%
R-R-R-R-R23 · 4.3%
기타 11개41 · 7.6%

INTERPRETATION NOTE32.2%는 전체 임산부의 비율이 아니다. 1,672개 GBS isolate 중 MDR phenotype을 보인 균주의 비율이다.

1,672균주 중 538균주(32.2%)가 MDR이었고, 주요 resistance pattern은 clindamycin·erythromycin·tetracycline 동시 내성이었다.MDR 비율과 동시 내성 항생제 조합을 함께 평가한다.

Bae HG, et al. Yonsei Med J. 2022;63:717–723 · Table 2

논문 3 · 검사법 차이에 따른 집락률 과소평가 가능성

PAPER 3 · GBS COLONIZATION · Yonsei Med J 2022

THIS STUDY본 연구의 검사 흐름
① Vaginal swab only질 면봉
② Direct inoculation5% sheep blood agar에
직접 접종
③ Incubation35–37°C · 5% CO2
24 h
④ Suspected coloniesMALDI Biotyper로
GBS 확인
주의 · Selective enrichment 없음일부 GBS carrier를 놓칠 가능성
VS
Direct plating

Selective enrichment
핵심 차이
검체 부위 + 증균 단계
CDC-RECOMMENDED회수율을 높이는 표준 접근
① Vaginal + rectal질 + 직장 면봉 채취
② Selective brothTodd Hewitt 또는
Lim broth
③ Blood agar증균 후 배지 접종
④ GBS recovery회수 가능성 증가
✓ GBS 회수율 증가검체 부위 확대 + 선택 증균
10.6%
실제 집락률은
더 높을 가능성본 연구에서 관찰된 전국 GBS 집락률
METHOD LIMITATION

논문 Discussion은 기존 근거를 인용해, selective enrichment 없이 direct agar plating을 쓰면 GBS carrier가 최대 약 50%까지 false-negative일 수 있다고 설명했다. 이 연구에서 정확히 50%가 누락됐다는 뜻은 아니다.

INTERPRETATIONObserved prevalence ≠ True prevalence

10.6%는 검사에서 관찰된 값이다. 검사 민감도가 낮으면 실제 prevalence보다 낮아질 수 있다.

집락률은 생물학적 차이뿐 아니라 검체 채취 부위와 배양 방법에도 영향을 받는다.이 연구의 10.6%는 direct vaginal culture 방식 때문에 실제 GBS 보균율을 과소평가했을 가능성이 있다.

Bae HG, et al. Yonsei Med J. 2022;63:717–723 · Methods / Discussion

2×2 표 · Chi-square와 Fisher’s exact

Pearson Chi-square test

Asymptotic approximation

X² 통계량을 카이제곱분포로 근사

표본과 기대빈도가 충분히 크면 정확검정과 매우 비슷한 결과가 나올 수 있음

Fisher’s exact test

Exact probability

고정된 주변합에서 가능한 2×2 표를 직접 계산

기대 빈도가 작아도 Type I error가 α를 넘지 않음

검정 선택 기준: 전체 N보다 expected cell count

논문 3

전체 자료 규모 N=33,721

대부분의 비교 셀에 충분한 관찰 수

Chi-square test

vs

논문 5

과거 37 vs 최근 209 균주

일부 범주 비교에서 희소 셀 발생

Fisher’s exact test

표본과 기대빈도가 충분히 크면 두 결과가 매우 비슷해질 수 있다.

이 논문은 비율 비교에 chi-square test를 우선 적용하고, 기대빈도가 작은 경우 Fisher’s exact test를 사용했다. Fisher’s exact test는 희소한 2×2 표에 적합하지만 조건부 검정이어서 다소 보수적일 수 있다. · Agresti (1992), Upton (1992)

미생물 다중결과 · 분석 층 + FDR

04 · MULTIPLICITY

양성/음성 · Ct value · 상대 풍부도 · Alpha/Beta diversity · 개별 OTU

미생물 분석 · 주요 결과변수 6종

qPCR 양성 / 음성

정한 균이 검출되었는가

범주형 · n (%) · Fisher’s exact

qPCR Ct value

몇 번째 cycle에서 신호가 잡혔는가 · 낮을수록 target DNA가 많음

연속형 · Mann–Whitney U

16S rRNA Relative abundance

그 검체의 전체 read 중 해당 분류군의 비율

합이 100%인 조성 자료 · 하나가 늘면 다른 것이 줄어듦

16S rRNA Alpha diversity

검체 하나 안의 다양성 · Chao1은 종의 수, Shannon은 종 수와 균등도

검체당 값 하나

16S rRNA Beta diversity

검체 사이 군집 구성의 거리 · 검체 쌍마다 거리를 계산

Principal components 기반 차원축소로 시각화
이 논문에서는 CRC군과 대조군 사이 유의한 차이 없음

16S rRNA 개별 OTU 비교

수백 개 분류군을 각각 검정 · 이 논문은 698개

다중검정 → FDR 보정

동일 검체에서도 분석법에 따라 평가 대상과 결과변수가 다르다.

Alpha diversity · 검체 하나 안의 다양성

일반 분석 방법론
정의 · 검체당 숫자 하나

검체 내 다양성의 핵심 지표

Observedrichness
Chao1unseen richness 보정
Shannonrichness + evenness
  • Observed OTUs = 검출된 분류군 수(richness)
  • Chao1 = Sobs + F1²/(2F2) · singleton(F1)과 doubleton(F2)으로 미관측 richness를 보정
  • Shannon H′ = −Σpilnpi · richness와 evenness를 함께 반영
  • Simpson = 1 − Σpi² · 두 read가 서로 다른 분류군일 확률이며, 우점 분류군 비중이 클수록 감소
  • 비교: 검체당 값 하나 → 군 간 Wilcoxon / Kruskal–Wallis 등 일반 검정

논문 4: observed · Chao1 · Shannon (QIIME) → CRC vs 대조군 차이 없음

예시 · 분류군 3개, 검체 A·B
비율 (%) 균1 균2 균3 Observed Shannon Simpson
검체 A 50 30 20 3 1.03 0.62
검체 B 10 30 60 3 0.90 0.54

종 수는 같아도 균3이 우점하는 B가 Shannon·Simpson 모두 낮음 → 균등도까지 반영

library(vegan)   # otu: 검체 × OTU count
alpha <- data.frame(
  observed = specnumber(otu),
  chao1    = estimateR(otu)["S.chao1", ],
  shannon  = diversity(otu, "shannon"),
  simpson  = diversity(otu, "simpson"))
alpha$group <- meta$group
wilcox.test(shannon ~ group, data = alpha)

Beta diversity ① · 검체 간 거리의 정의

일반 분석 방법론
검체 사이 차이 → distance/dissimilarity
Bray–Curtisabundance 반영Jaccardpresence/absenceUniFracphylogeny 반영
정의 · 검체 쌍마다 숫자 하나

검체 A와 B의 구성 차이: d(A, B)

균1 균2 균3
검체 A 50 30 20
검체 B 10 30 60
  • Bray–Curtis = Σ|xi − yi| / Σ(xi + yi) = (40 + 0 + 40) / 200 = 0.4 · 0 = 동일, 1 = 공유 없음 · 있냐뿐 아니라 얼마나 있냐(abundance)까지 반영
  • Jaccard = 1 − 공통 / 합집합 · 있냐/없냐만: {A, B, C} vs {A, B, D, E} → 공통 2, 합집합 5 → 0.6 · 희귀균도 존재 여부 자체로 반영

비슷한 검체 → 거리 작음 · 다른 검체 → 거리 큼 · 검체 n개면 모든 쌍 → n × n 거리행렬

UniFrac · 계통 정보까지 반영
  • Jaccard·Bray–Curtis: A ≠ B → 완전히 다른 균
  • UniFrac: A–B는 계통수에서 가까운 친척 → 거리 작음 (가지 길이 이용)
  • Unweighted = 유무 + 계통 · Weighted = 풍부도 + 계통
거리행렬 예시 · 검체 4개
A B C D
A 0 0.1 0.7 0.8
B 0.1 0 0.6 0.7
C 0.7 0.6 0 0.2
D 0.8 0.7 0.2 0

A–B끼리, C–D끼리 비슷 · 검체 500개면 500 × 500 숫자 → 사람이 못 봄 → 다음 장: 좌표로 펼치고(PCoA) 군 차이를 검정(PERMANOVA)

Beta diversity ② · 거리 기반 시각화와 군 간 비교

일반 분석 방법론
Distance matrix검체 × 분류군 표에서 계산
PCoA / NMDS거리 구조 시각화
PERMANOVA군 간 차이 검정
betadisper군 내 산포 확인
① 보기 · PCoA / NMDS

거리행렬 → 2차원 점

  • 점 하나 = 검체 하나 · 가까우면 구성 비슷, 멀면 다름
  • PCoA: 거리의 크기를 최대한 보존 (d = 1과 5의 비율을 살림)
  • NMDS: 거리의 순위를 보존 (A–B < A–C < A–D) · 복잡한 생태 거리에 자주 씀
  • 그림은 시각화일 뿐 → "두 군 다르다"는 검정으로

시퀀싱 count는 합이 고정된 조성 자료이므로 유클리드 PCA가 왜곡될 수 있다. CLR/Aitchison 접근은 다음 장에서 구분한다.

② 검정 · PERMANOVA (adonis2)

거리행렬 버전의 ANOVA

  • ANOVA: A군 평균 = B군 평균? · PERMANOVA: 다변량 공간에서 A군 중심 = B군 중심?
  • 거리행렬의 변동을 설명변수별로 나누고, 군 라벨을 섞는 permutation으로 pseudo-F의 P 계산
  • P = 군 차이가 있는가 · = 군이 전체 변동의 몇 %를 설명하는가 (예: R² = 0.08 → 8%)
  • 표본이 크면 R² 1~2%도 P가 매우 작을 수 있음 → 둘 다 보고
③ 함정 · betadisper

중심 차이인가, 퍼짐 차이인가

  • PERMANOVA는 군 내 산포(dispersion) 차이에도 영향을 받음 → 오른쪽처럼 중심은 같고 퍼짐만 달라도 유의할 수 있음
  • betadisper = 각 검체에서 자기 군 중심까지 거리의 평균이 군마다 같은가 = 다변량 Levene 검정
  • PERMANOVA P < 0.05 · betadisper P = 0.5 → 중심(구성) 차이로 해석 · 둘 다 유의 → "구성이 다르다"로 끝내지 말고 산포 차이도 함께 보고

조성 자료와 CLR · 비율 대신 로그비

일반 분석 방법론
상대풍부도는 합이 100%인 compositional data
한 균 증가 → 다른 균이 비율상 감소해 보일 수 있음
CLR = log-ratio로 변환
핵심 개념 · 조성 제약

상대풍부도의 합은 100%로 고정

균1 균2 균3 균2 / 균3
A count 60 30 10 3
B count · 균1만 3배 180 30 10 3
A 비율 (%) 60.0 30.0 10.0
B 비율 (%) 81.8 13.6 4.5
A CLR 0.83 0.14 −0.96 clr₂ − clr₃ = 1.10
B CLR 1.56 −0.23 −1.33 clr₂ − clr₃ = 1.10
  • 균2·3은 변하지 않았지만 비율은 30 → 13.6%, 10 → 4.5%로 감소해 보인다. 합 100% 제약은 가짜 음의 상관과 우점균 중심의 왜곡을 만들 수 있다.
  • CLR = log(xi/검체 기하평균) · 총 read 수가 약분되어 균 간 비율만 남는다. clr₂ − clr₃ = log(30/10) = 1.10으로 A·B가 동일하다.
  • CLR 후는 유클리드 공간 → PCA 가능 = Aitchison 거리 · 0 count는 pseudocount(+0.5) 또는 zCompositions::cmultRepl · 같은 논리의 차등풍부도: ALDEx2, ANCOM-BC
변환 후 해석 · CLR/Aitchison

Aitchison 거리 = CLR 벡터 사이의 유클리드 거리

dA(x, y) = ‖ clr(x) − clr(y) ‖2
  • CLR로 옮긴 뒤에는 보통의 유클리드 기하 → PCA를 그대로 쓸 수 있음
  • 같은 자료·같은 0 처리(pseudocount) 조건이면 CLR → PCA ≡ Aitchison 거리 → PCoA (검체 배치 동일, 축 부호만 다를 수 있음)
  • 같은 로그비 원리를 사용하는 차등풍부도 방법: ALDEx2, ANCOM-BC
clr <- log(otu + 0.5) - rowMeans(log(otu + 0.5))
prcomp(clr)                # CLR-PCA
cmdscale(dist(clr), k = 2) # Aitchison PCoA (동등)

PCA · PCoA · NMDS · 입력 자료와 보존 구조

일반 분석 방법론

PCA는 data matrix, PCoA는 distance matrix, NMDS는 distance rank를 기준으로 구분한다.

NMDS · Non-metric Multidimensional Scaling

GENERAL METHOD · 일반 microbiome 분석 개념
정의

NMDS는 검체 간 dissimilarity의 순위(rank order)가 저차원 공간에서도 최대한 유지되도록 각 검체의 좌표를 찾는 비모수적 ordination 방법이다.

Non-metric = 거리의 정확한 크기보다 순서관계를 보존
STEP 1 · Dissimilarity 계산
δij = Σk |xik − xjk|Σk (xik + xjk)
xik= 검체 i의 OTU k abundance
xjk= 검체 j의 OTU k abundance
δij= 검체 i–j의 Bray–Curtis dissimilarity
예시

검체 i = (10,20,0)  ·  검체 j = (5,25,10)

δij

= (5+5+10) / [(10+5)+(20+25)+(0+10)]

= 20/70

= 0.286

0 = 동일  ·  1에 가까울수록 더 다름
OTU abundance → Bray–Curtis δij 계산 → dissimilarity matrix → NMDS → 저차원 좌표
δij < δkl   ⇒   dij < dkl

모든 검체 쌍의 dissimilarity를 계산한 뒤, 그 순서가 저차원 공간에서도 최대한 유지되도록 좌표를 찾는다.

R · NMDS 실행 예
library(vegan)

# 1. Bray-Curtis dissimilarity
bc <- vegdist(otu, method = "bray")

# 2. NMDS
nmds <- metaMDS(
  bc,
  k = 2
)

scores(nmds)
plot(nmds)
vegdist() → Bray–Curtis dissimilarity matrix
metaMDS() → 저차원 NMDS 좌표 계산
scores()/plot() → 좌표 확인·시각화

WHY NMDS? · 고차원 → 저차원

고차원 community data를 2D/3D로 축약하면 원래 dissimilarity 구조에 왜곡이 생길 수 있다.

① 순위 보존

원래 dissimilarity의 rank order가 최대한 유지되도록 좌표를 조정

② Stress 평가

현재 저차원 배치의 불일치를 Stress로 평가

③ 좌표 갱신

Stress가 줄어드는 방향으로 좌표를 반복 갱신

고차원 → 저차원에서 생기는 왜곡을 줄이도록 검체 좌표를 반복 최적화

2D 좌표 배치 → Stress 평가 → 좌표 재조정 ↺ 반복

PCA · PCoA · NMDS · 방법론적 구분과 논문 4의 불명확성

일반 분석 방법론
PCAdata matrixPCoAdistance matrixNMDSdistance rank
① 정의와 동등 조건
  • PCA: 자료행렬 X → 분산이 큰 직교축 · 원자료의 유클리드 기하
  • PCoA: 거리행렬 D → 거리 구조를 좌표로 · 어떤 dissimilarity든 입력 가능
  • 같은 X(같은 표준화)의 Euclidean distance로 PCoA ≡ PCA → PCA = Euclidean PCoA의 특수한 경우
② 거리 재현과 음의 고유값
  • 원래 거리가 Euclidean이면 전체 차원 PCoA는 거리를 정확히 재현 · PCoA1–2만 그리면 저차원 투영(근사)
  • Bray–Curtis 등 non-Euclidean → 음의 고유값 = 오류가 아니라 "유클리드 공간에 완전히 못 넣는다"는 흔적
  • 축 설명 %는 convention에 따라 다름(vegan wcmdscale: Σλretained / Σ|λ| 또는 / Σλ>0) → 음의 고유값 크기 확인 · 작으면 대개 무시, 크면 Lingoes(d′ = √(d² + 2c), vegan이 우선 제시) · Cailliez(d′ = d + c) 보정
③ NMDS · 논문 4

논문 4의 방법론 기술은 불명확

  • NMDS: 거리 값이 아니라 rank order(dAB < dAC < dAD) 보존 · 적합도는 stress, metaMDS는 반복 실행으로 최소 stress 해
  • 논문 4는 principal components라고만 기술하여 PCA/PCoA가 명확하지 않다. QIIME의 표준 흐름은 거리행렬 → PCoA이다.
  • 방법론적 불명확성: 풍부도 행렬의 PCA인지 β-diversity 거리행렬의 PCoA인지 원문만으로 구분할 수 없다.

Beta diversity · R 코드와 결과 (모의자료)

일반 분석 방법론
Shannon P=0.986alpha diversity 차이 없음
PERMANOVA R²=0.225, P=0.001community composition 차이 · 군이 변동의 22.5%를 설명
betadisper P=0.968dispersion 차이로 설명되지 않음
보조 코드와 출력 · 검체 20개(CRC 10 · Control 10) × OTU 60개
bc  <- vegdist(otu, "bray")             # ① 거리행렬
pco <- cmdscale(bc, k = 2, eig = TRUE)   # ② PCoA 좌표
adonis2(bc ~ group, data = meta)         # ③ PERMANOVA
anova(betadisper(bc, meta$group))        # ④ 산포 동질성
> head(alpha, 3)
   observed chao1 shannon group
S1       55  55.6    3.68   CRC
S2       50  52.5    3.55   CRC
S3       57  58.5    3.61   CRC
> aggregate(shannon ~ group, alpha, median)
    group shannon
1 Control   3.640
2     CRC   3.645
> wilcox.test(shannon ~ group)      →  P = 0.986
> PCoA 축 설명 비율: PCo1 23.6%, PCo2 10.0%
> adonis2(bc ~ group, data = meta, permutations = 999)
         Df SumOfSqs    R2     F Pr(>F)
Model     1    0.526 0.225 5.227  0.001
Residual 18    1.811 0.775    NA     NA
Total    19    2.337 1.000    NA     NA
> anova(betadisper(bc, group))     →  P = 0.968
PCoA · 점 하나 = 검체 하나
Bray–Curtis PCoA: CRC와 Control 검체가 다른 위치에 모임
결과 해석

PCo1·PCo2는 변동의 23.6% · 10.0%만 표시한다. 그림은 요약이며 검정은 거리행렬 전체를 사용한다.

논문 4 · qPCR과 16S rRNA의 분석 역할

PAPER 4 · CRC MICROBIOME · Sci Rep 2020

STUDY POPULATION · CRC

CRC 38 patients → 39 CRC samples

한 환자에서 primary adenocarcinoma lesion 2개

38명 / 39조직환자 수와 조직 수 구분
조직 검체
STUDY POPULATION · CONTROL

Control 21 individuals

대조군의 normal tissue

21명normal tissue

qPCR

특정 CRC-associated bacteria 검출
Fusobacterium nucleatumcolB+ E. colibft+ Bacteroides fragilisEnterococcus faecalisStreptococcus gallolyticus
Positive / NegativePositive rate → Fisher’s exact test
Ct valueMann–Whitney U test
특정 균이 있는가 · 얼마나 많이 검출되는가

16S rRNA sequencing

전체 microbial community 분석
Relative abundance분류군별 상대풍부도
Alpha diversity검체 안의 다양성
Beta diversity검체 사이 군집 차이
Individual OTUs개별 OTU 비교
총 698 OTUsmultiple testingFDR correction
전체 세균 군집을 폭넓게 탐색
qPCR · Targeted특정 균을 미리 정해서 검사
VS
16S · Community-wide전체 세균 군집을 폭넓게 탐색

qPCR은 특정 균의 검출을, 16S rRNA는 전체 미생물 군집의 구성을 본다.같은 조직에서 나온 결과라도 분석법에 따라 질문과 통계 방법이 달라진다.

Kim M, et al. Sci Rep. 2020;10:19915 · Methods / Results

논문 4 · Table 2: CRC 관련 세균 qPCR 검출률

PAPER 4 · CRC MICROBIOME · Sci Rep 2020

Table 2 crop showing qPCR detection of five CRC-associated bacteria in 39 CRC carcinoma tissues and 21 control normal tissues, with Fusobacterium nucleatum highlighted
Table 2 발췌·강조 · CRC 관련 세균 5종의 qPCR 검출률 비교
INTERPRETATION NOTE

82.1%는 환자 전체의 장내 Fusobacterium 비율이 아니라, CRC carcinoma tissue에서 qPCR로 F. nucleatum이 검출된 비율이다.

검출률 · prevalence상대풍부도 · relative abundance
KEY RESULT

Fusobacterium nucleatum

CRC32 / 3982.1%
VS
CONTROL0 / 210%
P < 0.0001

CRC carcinoma tissue에서 유일하게 뚜렷한 검출률 차이를 보인 세균

OTHER BACTERIA

나머지 4개는 유의한 차이 없음

모두 P > 0.05
colB+ E. coli38.5% vs 19.0%P=0.1538
bft+ B. fragilis35.9% vs 38.1%P=1.0000
Enterococcus faecalis15.4% vs 4.8%P=0.4037
Streptococcus gallolyticus0% vs 4.8%P=0.3500
STATISTICAL TEST

Fisher’s exact test

qPCR positive / negative 비율 비교

PositiveNegativeCRC327Control021
→ Fisher’s exact · P < 0.0001

5개 후보 세균 중 F. nucleatum만 CRC 조직에서 뚜렷하게 높은 qPCR 검출률을 보였다.CRC 82.1% vs control 0% · Fisher’s exact P < 0.0001

Kim M, et al. Sci Rep. 2020;10:19915 · Table 2

논문 4 · Figure 1: F. nucleatum의 병기·조직별 분포

PAPER 4 · CRC MICROBIOME · Sci Rep 2020

Figure 1 A, B, C: F. nucleatum detection by tumor stage, tissue type, and fadA virulence gene prevalence in CRC and control tissues
Figure 1 · F. nucleatum의 tumor stage·tissue type 및 fadA 검출 결과
A · TUMOR STAGE

초기·후기 모두 높은 검출률

Control0 / 210%
Early I/II12 / 1392.3%
Late III/IV20 / 2676.9%

두 CRC stage 모두 control보다 높음 · P<0.0001 each
Early vs Late 자체의 차이는 유의하지 않음

B · TISSUE TYPE

암 조직에서 가장 높음

Carcinoma tissue · CT32/39 · 82.1%
Adjacent normal · AT38.9%
Non-CRC-site normal · NT33.3%
Control tissue0%
CT vs AT · P=0.0002CT vs NT · P<0.0001

같은 CRC 환자에서도 F. nucleatum은 carcinoma tissue에 더 집중됨

C · fadA VIRULENCE GENE

fadA도 CRC tissue에서 더 흔함

CRC carcinoma tissue69.2%
VS
Control tissue9.5%
P < 0.0001

adhesion / invasion 관련 virulence factor

qPCR Ct VALUE

qPCR-positive 조직끼리 비교했을 때 carcinoma tissue의 Ct가 AT/NT보다 더 낮았다. Mann–Whitney U · P<0.0001
낮은 Ct → 상대적으로 더 많은 target DNA

Figure 1 직접 표시 아님
Ct comparison: Results / Supplementary Fig. S1

F. nucleatum 검출률은 CRC 초기·후기 모두 높았으며, 동일 환자의 carcinoma tissue에서 더 높았다.검출 여부와 조직 위치에 따른 분포를 구분해 해석한다.

Kim M, et al. Sci Rep. 2020;10:19915 · Figure 1

Beta diversity · 검체 간 미생물 군집 차이

 차원축소 플롯: 점 하나는 검체 하나이며 점 사이 거리는 검체 간 미생물 군집 구성 차이를 나타냄
개념도 · principal component plot과 같은 차원축소 플롯 읽기
SAMPLE REPRESENTATION

점 하나 = 검체 하나

각 조직 검체의 전체 microbial composition을 저차원 공간의 한 점으로 표현
수백 개 OTU 정보가 몇 개 축으로 요약됨

DISTANCE

점 사이 거리 = 군집 구성 차이

가까운 점미생물 구성이 상대적으로 비슷함
멀리 떨어진 점미생물 구성이 상대적으로 다름
집단 분리는 군집 차이 가능성을 시각화하지만, 그림만으로 통계적 유의성을 확정하지 않음
THIS STUDY

CRC vs Control

β-diversity · 유의한 차이 없음α-diversity도 유의한 차이 없음

전체 microbial community 수준에서 두 집단이 뚜렷하게 분리되지 않음

ALPHA DIVERSITY · 한 검체 안species richness / evenness
VS
BETA DIVERSITY · 검체 사이community composition difference
전체 군집 차이가 없어도 개별 OTU는 다를 수 있다.다음: 698개 OTU의 다중검정과 FDR →

Beta diversity는 검체 사이의 전체 미생물 군집 차이를 본다.이 연구에서는 CRC와 control 사이의 α·β diversity 차이가 유의하지 않았다.

Kim M, et al. Sci Rep. 2020;10:19915 · Methods / Supplementary Fig. S2

다중검정 · 698개 OTU의 FDR 보정

ONE TEST
검정 1회P < 0.05

한 가지 가설만 검사할 때는 하나의 P-value를 해석

VS
698 TESTS
698 OTUs각각 비교

비교값 = 각 OTU의 relative abundance(검체 내 read 비율) · 검체 단위로 CRC vs control 개별 검정 (검정법은 논문에 명시 없음)

검정 수 ↑ → 우연히 작은 P-value도 늘어날 수 있음
698 OTUs분석 시작
OTU별 CRC vs Control 비교individual tests
698개 raw P-values보정 전 결과
FDR correctionmultiple testing correction
6 OTUsFDR 보정 후 유의
FDR

False Discovery Rate

여러 결과를 동시에 유의하다고 판단할 때, 그 발견들 중 거짓 양성이 포함되는 비율을 통제하는 접근

multiple testing correction
FDR-ADJUSTED RESULT
6 / 698 OTUsCRC vs control에서
FDR 보정 후 유의한 차이
PeptostreptococcusCollinsellaPrevotellaParvimonasFusobacteriumGemella
α·β diversity는 유의하지 않았지만, 개별 OTU 수준에서는 차이가 남았다.  → 다음 Figure 2

수백 개 OTU 비교는 raw P-value가 아닌 FDR 보정으로 판단한다.698개 중 보정 후 6개 OTU가 CRC와 control 간 차이를 보였다.

Kim M, et al. Sci Rep. 2020;10:19915 · Methods / Results / Figure 2

논문 4 · Figure 2: CRC와 대조군에서 다른 6개 OTU

PAPER 4 · CRC MICROBIOME · Sci Rep 2020

CASE = CRC patientsCONTROL = controlsY-axis = relative abundanceBoxplot = 분포 비교
Figure 2 crop of six OTU relative-abundance boxplots comparing CRC cases and controls, with the Fusobacterium panel highlighted
Figure 2 · CRC와 control 사이에서 차이를 보인 6개 OTU각 패널의 y-axis scale은 서로 다름 · genus 간 절대 높이 직접 비교 금지
FDR-ADJUSTED RESULT

FDR 보정 후 차이가 남은 6개 genus

6 / 698 OTUs
PeptostreptococcusCollinsellaPrevotellaParvimonasFusobacteriumGemella

CRC case와 control 사이 relative abundance 차이

ANALYSIS LEVEL

전체 군집과 개별 OTU

α / β diversity유의한 차이 없음
Individual OTUs6개에서 차이

전체 군집 수준과 개별 OTU 수준의 결과는 다를 수 있음

KEY RESULT

Fusobacterium

CRC에서 더 높은 relative abundanceFigure 표시 P = 6.8 × 10-5

qPCR에서도 CRC tissue의 F. nucleatum 검출률이 높아, 두 분석법에서 일관된 연관성이 관찰됨 · 측정값은 서로 다름

전체 α·β diversity에는 차이가 없었지만, 698개 OTU 중 6개 genus는 CRC와 control 사이에서 차이를 보였다.전체 군집 수준의 결과와 개별 feature 수준의 결과는 서로 다를 수 있다.

Kim M, et al. Sci Rep. 2020;10:19915 · Figure 2

논문 4 · Figure 3: 음주와 Fusobacterium 상대풍부도

PAPER 4 · CRC MICROBIOME · Sci Rep 2020

LEFT · CRC cases · P = 0.003RIGHT · Controls · P = 0.636Y-axis · Relative abundance (%)
Figure 3 boxplots comparing Fusobacterium relative abundance between heavy and non/light drinkers in CRC patients and controls
Figure 3 · 음주군별 Fusobacterium relative abundance 비교두 패널의 y-axis scale이 서로 다름 · CRC와 control의 box 높이 직접 비교 금지
CRC PATIENTS

Heavy drinker에서 더 높은 abundance

P = 0.003Heavy drinker
vs Non/light drinker

Fusobacterium OTU의 relative abundance 분포가 heavy drinker에서 더 높음

CONTROLS

차이 없음

P = 0.636Heavy vs Non/light

Control에서는 같은 패턴이 관찰되지 않음

ANALYSIS DISTINCTION

양성률과 상대풍부도의 구분

TABLE 4 · 양성 / 음성≥1% 기준의 양성 여부Heavy · 14/15 positive · 93.3%Non/light · 11/17 positive · 64.7%Fisher’s exact · P = 0.0886/17은 negative
FIGURE 3 · 연속형 abundance연속형 상대풍부도실제 relative abundance 전체 분포 비교CRC · P = 0.00316S rRNA 결과 · qPCR 결과가 아님일반적인 0.05 기준에서 Table 4 P=0.088은 유의하지 않음
P = 0.088과 P = 0.003은 서로 다른 분석 결과
ASSOCIATION / CAUSATIONCRC 환자에서 heavy drinking과 높은 Fusobacterium abundance가 연관됨Alcohol → Fusobacterium → CRC 인과 경로는 확인되지 않음

CRC 환자에서는 heavy drinker의 Fusobacterium 상대풍부도가 더 높았지만(P=0.003), control에서는 같은 패턴이 없었다(P=0.636).검출 여부(P=0.088)와 상대풍부도(P=0.003)는 서로 다른 분석이다.

Kim M, et al. Sci Rep. 2020;10:19915 · Figure 3 / Table 4

논문 4 · 연관성 해석과 연구의 한계

PAPER 4 · CRC MICROBIOME · Sci Rep 2020

HEAVY ALCOHOLEXPOSURE
FUSOBACTERIUM ↑RELATIVE ABUNDANCE
CRCDISEASE
Association observed · Causal pathway not established
OBSERVED ASSOCIATIONS

관찰된 연관성

CRC tissue에서 F. nucleatum 검출률이 높음 · 82.1% vs control 0%
CRC 환자의 heavy drinker에서 Fusobacterium relative abundance가 더 높음 · Figure 3 · P=0.003
qPCR-positive sample은 16S에서도 Fusobacterium abundance가 높은 경향
LIMITS OF INTERPRETATION

이 연구에서 확인되지 않은 인과관계

×술이 Fusobacterium을 증가시킨다
×Fusobacterium 증가가 CRC를 발생시킨다
×Alcohol → Fusobacterium → CRC 순차 인과 경로
×Fusobacterium을 줄이면 CRC가 예방된다
LIMITATION 1

Small sample size

CRC 38명 · 39 samples
Control 21명
작은 표본이 통계적 유의성을 제한할 수 있음

LIMITATION 2

Tubular adenoma 별도군 분석 불가

대조군 일부가 tubular adenoma였으나 표본이 작아 독립된 adenoma group으로 분석하지 못함

LIMITATION 3

1% OTU cutoff

검체 내 상대풍부도 ≥ 1%면 그 균 "양성"으로 정의 (미량 read를 양성으로 세지 않기 위한 임의 기준)
추가 연구로 cutoff 확인 필요

STRENGTH

한 연구에서 동시에 통합 분석

qPCR16S rRNADemographicsClinical data

서로 다른 측정 결과를 함께 해석할 수 있음

CRC·Fusobacterium·음주 연관성은 관찰됐지만, Alcohol → Fusobacterium → CRC 인과 경로는 확인되지 않았다.작은 표본과 제한된 subgroup 분석을 고려해야 한다.

Kim M, et al. Sci Rep. 2020;10:19915 · Discussion / Limitations

WGS · 계통 + 내성 조합

05 · PROFILE

표현형 · ST/CC · cps · ARG · AMR profile · 시간 변화

논문 5 · 연구 설계: 과거 37 vs 최근 209 GBS 균주

PAPER 5 · GBS WGS · Ann Lab Med 2025

 WGS 결과 도식: isolate별 CC, cps genotype, ST, phenotypic AMR, ARG와 AMR profile을 범주형 변수로 정리
도식 · GBS isolate별 WGS·내성 결과를 범주형 변수로 정리
TOTAL · 246 GBS isolates
PAST371994–2000 · isolates
VS
RECENT2092017–2022 · isolates

GBS isolate 하나에 붙는 정보

CC큰 계통 · clonal complex
cpscapsular genotype
STsequence type
AMR실제 표현형 내성
ARG내성 관련 유전자
PROFILE여러 항생제 내성 조합
분석 단위 = 사람 × · 검체 ×
GBS isolate 1개
각 시대의 기본 분모: 37과 209
1/37 = 2.7% · 32/209 = 15.3%
CC 내부가 아닌 시대 전체 isolate 중 비율
STUDY WORKFLOW
GBS isolateAST / WGS 병렬 분석통합 결과두 시기 n (%) 비교
PROPORTION COMPARISON

두 독립 시기의 비율 비교
Primary · Chi-square
Sparse expected cells · Fisher’s exact
전체 N만으로 검정을 선택하지 않음

이 논문은 GBS isolate별로 계통·유전자·내성 정보를 통합한 뒤, 과거 37균주와 최근 209균주의 구성을 비교했다.WGS 결과도 결국 isolate 단위의 n (%)로 정리되어 시대 간 비교된다.

Ahn K, et al. Ann Lab Med. 2025 · Methods / Table 1–3

논문 5 · AST와 WGS의 통합 분석 흐름

PAPER 5 · GBS WGS · Ann Lab Med 2025

GBS ISOLATE
AST

Phenotypic resistance

항생제별 감수성·내성 표현형
MicroScan MicroSTREP Plus Panel
PenicillinAmpicillinCefepimeCefotaximeCeftriaxoneMeropenemVancomycinErythromycinClindamycinTetracyclineLevofloxacinChloramphenicol
WGS

Genotype / lineage

계통·피막 유전형과 내성 관련 유전자를 확인
STsequence type
CCclonal complex
cpscapsular genotype
ARGresistance gene
MLSBermB · ermT · lnuB · lsaC · mefA · msrD
TETtetM · tetO
LEVgyrA · gyrB · parC · parE
CHLcatA

INTEGRATED
ANALYSIS

Phenotype resistanceST / CC / cpsARGResistance profileTime period
1994–2000
VS
2017–2022 · 비율 비교
PHENOTYPE항균제 감수성 검사 결과
GENOTYPE · ARG presence내성 관련 유전자 보유 여부
METHOD CONSISTENCYAST는 동일 기관·같은 MicroScan panel로 통일해 시행
WGS도 동일한 analytical pipeline 적용

같은 GBS 균주에서 AST로 표현형 내성을, WGS로 계통·ARG 정보를 얻어 두 시대의 내성 구성을 함께 비교했다.표현형과 유전형은 연결되어 있지만 동일한 결과변수는 아니다.

Ahn K, et al. Ann Lab Med. 2025 · Methods

논문 5 · Table 1: GBS 계통 구성의 시간 변화

PAPER 5 · GBS WGS · Ann Lab Med 2025

Table 1 showing ST, CC and cps genotype counts and percentages among 37 past and 209 recent GBS isolates
Table 1 · 1994–2000년과 2017–2022년의 ST·CC·cps genotype 분포
DOMINANT CC

우세 CC의 변화

PAST · 1994–2000CC1914 / 37 · 37.8% 본문은 13/37 · 35.1% (불일치)
RECENT · 2017–2022CC174 / 209 · 35.4%
INCREASE

CC1 · cps VIII

PAST1 / 37 · 2.7%
RECENT32 / 209 · 15.3%
P = 0.037

과거 ST1 1균주 → 최근 32균주는 모두 ST2

DECREASE

CC19 · cps III

PAST14 / 37 · 37.8%
RECENT36 / 209 · 17.2%
P = 0.004

비율 감소

NEWLY EMERGED

CC19 · cps V

PAST0 / 37 · 0%
RECENT24 / 209 · 11.5%
P = 0.031

과거에는 없었지만 최근 집단에서 확인

DECREASE

CC12 · cps Ib

PAST10 / 37 · 27.0%
RECENT28 / 209 · 13.4%
P = 0.034

메인 결과는 원표(Table 1) 값 사용

TABLE 읽는 법 · 기본 분모는 시대별 전체 isolate 수PAST 37 · RECENT 209 · 1/37=2.7% · 32/209=15.3%
CC 내부 비율이 아니라 각 시대 전체 isolate 중 비율
※ 원문 내부 수치 주의 · CC19은 본문·초록에서 13/37(35.1%)이나 Table 1 세부행 합계(cps III 14 + V 0 + Ib 0)는 14/37(37.8%). 본 슬라이드는 CC19에도 Table 1 값을 사용함.
CC12–Ib는 본문 27/209(12.9%), P=.027; Table 1은 28/209(13.4%), P=.034. 본 슬라이드는 CC12–Ib에 원표 값을 사용함. 희소 cell 비교 · Fisher’s exact

1994–2000과 2017–2022 사이에 GBS의 주요 계통 조합이 뚜렷하게 재편되었다.과거 우세 CC는 CC19, 최근 우세 CC는 CC1이며, 여러 cps·ST 조합이 증가·감소 또는 새롭게 등장했다.

Ahn K, et al. Ann Lab Med. 2025 · Table 1

논문 5 · Figure 1: 표현형 내성과 ARG의 시간 변화

표현형 내성률과 내성 유전자 보유율 변화

Figure 1. 시기별 표현형 내성과 관련 내성 유전자 변화 · Ahn K, et al. Ann Lab Med 2025

TETRACYCLINE R 97.3% → 60.8% P < 0.001

tetO 2.8% → 29.9% P = 0.017

LEVOFLOXACIN R 0% → 23.4% P = 0.001

tetM 91.7% → 72.4% P < 0.001

표현형 내성과 ARG prevalence를 시기별로 각각 비교 · 균주 단위 일치도는 별도 분석

Genotype–phenotype · 비율 비교와 일치도 분석

THIS PAPER

시기별 비율 비교

1994–2000VS2017–2022
Phenotype · Tetracycline R97.3% → 60.8%
ARG · tetM91.7% → 72.4%
ARG · tetO2.8% → 29.9%
Population-level proportion comparison
vs
AGREEMENT ANALYSIS

균주 단위 일치도

같은 isolate의 ARG × phenotype
Phenotype R
Phenotype S
ARG +
a
b
ARG −
c
d
일치도 연구를 한다면 계산 가능한 지표
SensitivitySpecificityPPVNPVCohen’s κ95% CI
이 논문이 실제 계산한 결과는 아님
POPULATION TREND AND ISOLATE CONCORDANCE
Phenotype resistance ↓
ARG prevalence ↓
같은 isolate에서
ARG와 resistance가 일치함

두 비율의 시기별 변화 방향이 유사해도 개별 isolate의 대응은 별도 2×2 분석 없이는 평가할 수 없음

THIS PAPER · 정확한 결론

ARG prevalence와 phenotypic resistance의 시간 변화를 각각 분석했다.

Isolate-by-isolate genotype–phenotype concordance는 별도로 평가하지 않았다.

ARG presence내성 관련 유전자 보유
vs
Phenotypic resistance검사에서 확인된 내성 표현형
gene presence와 phenotype 사이에는
expression · functional mutation · breakpoint · other mechanisms가 존재

시기별 phenotype·ARG 비율 변화와 균주별 genotype–phenotype 일치도는 별도 분석이다.이 논문은 전자만 분석했으며, sensitivity·specificity·kappa 일치도는 수행하지 않았다.

논문 5 · Table 2: 시기별 AMR profile 분포 변화

PAPER 5 · GBS WGS · Ann Lab Med 2025

Table 2 comparing antimicrobial resistance profiles among 37 past and 209 recent GBS isolates
Table 2 · 1994–2000년과 2017–2022년의 AMR profile 분포
PROFILE DIVERSITY

AMR profile 종류 증가

PAST6profiles
RECENT16profiles
최근 새롭게 확인된 pattern 11종

개별 내성률이 아니라 한 isolate의 동시 내성 조합 수

NO RESISTANCE

내성이 없는 isolate도 증가

PAST1 / 37
2.7%
RECENT50 / 209
23.9%
P = 0.003

Profile 다양성 증가는 모든 isolate의 내성 증가를 의미하지 않음

TET ONLY

과거의 지배적 단독 profile 감소

PAST20 / 37
54.1%
RECENT39 / 209
18.7%
P < 0.001

Tetracycline 내성이 사라진 것이 아니라 TET-only 비중이 감소

PERIOD-SPECIFIC PROFILES

특정 시기에만 나타난 조합 증가

PAST1 / 37
2.7%
RECENT61 / 209
29.2%
P < 0.001

Table 2의 common vs period-specific 전체 비교

AMR PROFILE 읽는 법
TET = tetracycline resistance only
ERY-CLI-TET = 3개 약 동시 내성
ERY-CLI-TET-LFX = 위 3개 + levofloxacin 내성
ERY erythromycin · CLI clindamycin · TET tetracycline · LFX levofloxacin · CHL chloramphenicol
COMMON vs PERIOD-SPECIFIC · P < 0.001
CONSISTENTLY COMMON94.6% → 46.9%
VS
PERIOD-SPECIFIC2.7% → 29.2%
반복되던 조합 비중은 줄고 최근 시기에만 관찰된 조합은 증가
AMR PROFILE DIVERSITY

No resistance ↑ · TET-only ↓ · 새로운 복합 profiles ↑
AMR profile diversity가 증가함

Levofloxacin 관련 81.8%(초록)와 80.3%(본문)는 분모·표현이 달라 직접 결합하지 않음

GBS 내성 profile은 과거 6종에서 최근 16종으로 증가했으며, 최근 시기에만 관찰된 새로운 내성 조합의 비중이 증가했다.개별 내성률과 여러 항생제 내성의 조합을 함께 평가한다.

Ahn K, et al. Ann Lab Med. 2025 · Table 2

논문을 읽을 때 확인할 7가지

01

연구 질문

무엇을 추정하거나 비교하는가?
범위 · 차이 · 비율 · 군집 · profile

02

분석 단위

사람 · 검체 · 조직 · 균주
“무엇 하나가 N=1인가?”

03

분자와 분모

n / N (%)에서
무엇을 무엇으로 나눴는가?

04

자료 구조

독립 자료인가?
paired / repeated data인가?

05

효과크기와 불확실성

P-value만 보지 말고
차이의 크기 · 95% CI · 표본수 확인

06

다중검정

여러 feature를 동시에 비교했다면
FDR 등 correction 여부 확인

07

해석 범위

연관성인가 인과성인가?

참고집단 · 검사법 · 표본선정이
결론의 적용 범위를 어디까지 제한하는가?

연구 질문 → 분석 단위 → 결과변수 → 통계 방법 → Figure/Table → 해석P-value는 마지막에 본다.

핵심 요약

01

PTH 참고구간 · 집단 차이 검정 X · 검사값 분포 범위

02

TG 검사법 비교 · Correlation ≠ Agreement

03

GBS 집락률 · 분모 및 분석 단위 확인

04

CRC 미생물 · 전체 군집 / 개별 feature / FDR

05

GBS WGS · 계통 / ARG / 표현형 / profile

06

논문 통계 · 연구 질문 → 분석 단위 → 방법

연구 질문 → 분석 단위 → 결과변수 → 통계 방법 → Figure/Table → 해석