수능영어 41~42번은 한 지문에 문제가 둘 붙어 있습니다. 41번은 제목을 고르고, 42번은 문맥에 맞지 않는 낱말을 고릅니다. 같은 지문을 공유하지만, 두 문항이 요구하는 판단은 다릅니다.
저희는 43~45번 장문 세트(순서·지칭·일치)를 먼저 다뤘고, 같은 장문 구조인 41~42번은 아직 다루지 않았습니다. 이번에 채워 넣습니다. 결과를 한 문장으로 줄이면 이렇습니다. 지문은 하나지만, 저희 코딩에서 두 문항의 1위 함정은 서로 달랐습니다.
무엇을 셌는가 — 범위부터 밝힙니다
숫자를 보기 전에 이 집계가 어디까지를 다루는지 분명히 해 두겠습니다.
저희 영어 기출 데이터베이스(gichul_e_db_enriched.csv, 총 6,615행)에는 여러 시행 주체의 시험이 함께 들어 있습니다. 이 글은 그중 평가원이 주관한 6월 모의평가·9월 모의평가·수능만 뽑았습니다. 고1·고2·고3 학력평가는 전량 제외했습니다.
기간은 데이터베이스의 「연도」 컬럼 기준 2014~2025년 시행, 12년입니다. 이 컬럼은 시행연도라서 학년도 표기로는 +1이 됩니다(2014년 시행 = 2015학년도). 그래서 학년도로 바꾸면 2015학년도 ~ 2026학년도입니다.
| 항목 | 값 |
|---|---|
| 시행 주체 | 한국교육과정평가원 (6월 모평·9월 모평·수능) |
| 기간 | 2014~2025년 시행 (2015~2026학년도, 12년) |
| 세트 | 36세트 (12년 × 3회차) |
| 문항 | 41번 36건 + 42번 36건 = 72문항 |
| 결측 | 0건 (36세트 전수) |
| 제외 | 교육청 학력평가 전량 |
오답률은 이 글에서 한 번도 인용하지 않았습니다. 난도에 관해 저희가 전수로 가지고 있는 값은 배점뿐이라, 배점까지만 다룹니다.
이 “함정 유형”이 무엇이고 무엇이 아닌지
아래에 나올 유형 이름은 코그닉스랩이 문항을 읽고 붙인 자체 태깅 라벨입니다. 평가원이 공표한 공식 분류가 아닙니다. 이 구분을 먼저 박아 두는 이유는, 뒤에 나오는 표가 “평가원이 이렇게 출제한다”가 아니라 “저희 기준으로 코딩했더니 이렇게 갈렸다” 이기 때문입니다.
또 하나. 이 자료는 문항 하나에 라벨이 하나씩 붙어 있어 각 문항 번호의 유형별 합계가 정확히 36이 됩니다. 한 문항에 두 함정이 겹쳐 보일 때 어떤 원칙으로 하나를 골랐는지는 이 집계만으로 확인하지 못했습니다.
41번(제목) — 두 종류가 88.9%
| 순위 | 함정 유형 | 문항 수 | 비율 |
|---|---|---|---|
| 1 | 패러프레이즈 함정 | 19 | 52.8% |
| 2 | 키워드 함정 | 13 | 36.1% |
| 3 | 범위 확대·축소 | 4 | 11.1% |
41번은 세 종류로 36건이 다 채워집니다. 1위 패러프레이즈가 절반을 넘고(52.8%), 2위 키워드까지 합치면 88.9% 입니다.
제목 문항이라는 자리를 생각하면 두 유형의 성격이 대비됩니다. 패러프레이즈는 지문의 표현을 다른 말로 바꿔 선지에 넣는 방식이고, 키워드는 지문에 실제로 나온 낱말을 선지에 그대로 얹는 방식입니다. 저희 코딩에서 41번은 이 둘 사이에서 갈렸습니다.
42번(어휘) — 다섯 종류, 1위가 바뀝니다
| 순위 | 함정 유형 | 문항 수 | 비율 |
|---|---|---|---|
| 1 | 유사어 혼동 | 16 | 44.4% |
| 2 | 패러프레이즈 함정 | 15 | 41.7% |
| 3 | 낯선 의미 | 3 | 8.3% |
| 4 | 키워드 함정 | 1 | 2.8% |
| 5 | 인과 역전 | 1 | 2.8% |
42번의 1위는 유사어 혼동 16건(44.4%) 으로, 41번에서는 0건이던 유형입니다. 2위 패러프레이즈(15건, 41.7%)와의 차이는 1건뿐이라 사실상 두 유형이 상위를 나눠 가지고 있습니다(둘을 합치면 86.1%).
겹치는 축 하나, 갈라지는 축 둘
두 표를 나란히 놓으면 세 가지가 보입니다.
| 함정 유형 | 41번 | 42번 |
|---|---|---|
| 패러프레이즈 함정 | 19 (52.8%) | 15 (41.7%) |
| 유사어 혼동 | — | 16 (44.4%) |
| 키워드 함정 | 13 (36.1%) | 1 (2.8%) |
| 범위 확대·축소 | 4 (11.1%) | — |
| 낯선 의미 | — | 3 (8.3%) |
| 인과 역전 | — | 1 (2.8%) |
첫째, 공통 축은 패러프레이즈 하나입니다. 두 문항에 걸쳐 34건(72문항의 47.2%)으로, 41·42번 전체에서 가장 많은 유형입니다. 같은 지문을 두 번 쓰는 세트에서 양쪽 모두 상위 2위 안에 드는 유형은 이것뿐입니다.
둘째, 키워드 함정은 41번 쪽으로 쏠립니다. 13건 대 1건입니다.
셋째, 유사어 혼동(16건)과 낯선 의미(3건)는 42번에서만, 범위 확대·축소(4건)는 41번에서만 나타납니다. 두 문항에 등장한 유형은 합쳐서 6종인데, 그중 4종이 한쪽에만 붙어 있습니다.
데이터베이스 자체가 이미 둘을 갈라 놓았습니다
숫자보다 먼저 확인해 둘 것이 있습니다. 저희 데이터베이스에서 41번과 42번은 대분류부터 다릅니다.
| 문항 | 대분류 | 소분류 |
|---|---|---|
| 41번 | 장문독해 | 장문(제목) |
| 42번 | 어법어휘 | 장문(어휘) |
지문이 같은 한 세트인데 대분류가 갈립니다. 이것은 저희 분류 체계의 사실이지, 평가원이 41·42번을 공식적으로 다른 영역으로 구분한다는 뜻이 아닙니다.
동시에 이 사실은 앞의 함정 분포에 대한 가장 날카로운 반론의 근거이기도 합니다. 42번이 애초에 ‘어법어휘’로 분류되는 어휘 문항인 만큼, 거기에 ‘유사어 혼동’이 많이 붙는 현상에는 문항의 성격과 저희 태깅 기준이 구조적으로 연동된 영향이 있을 수 있습니다. 다만 대분류 ‘어법어휘’와 함정 라벨 ‘유사어혼동’이 실제로 같은 기준에서 파생됐다는 증거 또한 이 자료에는 없습니다. 이 집계만으로는 그 가능성을 분리해 낼 수 없습니다. 본보기가 될 만한 검사 — 같은 함정이 다른 번호에도 흩어져 나타나는지를 보는 교차 검사 — 는 이 집계가 41·42번 두 자리만 다루기 때문에 하지 않았습니다. 그러니 유사어 혼동이 42번에 몰린다는 항목만은 “발견”으로 읽지 말아 주십시오.
반대로 41번 쪽의 키워드 함정 36.1%나, 패러프레이즈가 양쪽에 걸쳐 47.2%를 차지한다는 결과는 소분류 이름에서 곧바로 따라 나오는 값이 아닙니다.
배점 — 같은 지문, 다른 값
배점은 72문항 전부가 값을 가지고 있습니다.
| 문항 | 2점 | 3점 |
|---|---|---|
| 41번 | 34건 (94.4%) | 2건 (5.6%) |
| 42번 | 10건 (27.8%) | 26건 (72.2%) |
같은 지문을 읽고 푸는 두 문제인데 배점 분포가 거의 뒤집혀 있습니다. 41번은 열에 아홉 이상이 2점이고, 42번은 열에 일곱 이상이 3점입니다. 두 문항을 합친 3점 28건 중 26건(92.9%)이 42번 자리입니다.
여기서 한 걸음 더 나가고 싶어지지만 멈추겠습니다. 왜 42번 쪽에 3점이 더 많이 배정되는지에 대한 평가원의 공식 설명은 이 집계로 확인하지 못했습니다. 배점은 데이터베이스에 기록된 실제 값이고, 이 글이 말할 수 있는 것은 “이렇게 분포한다”까지입니다.
이 글이 하지 않은 것
마지막으로 경계를 적어 둡니다.
연도별로 나눠 보지 않았습니다. 여기 있는 모든 비율은 36세트를 한 덩어리로 합친 값입니다. 그래서 이 글은 “최근 이런 경향이 있다”, “예전보다 늘었다” 같은 시간에 관한 말을 한 문장도 하지 않았습니다. 36건을 12년으로 나누면 연 3건이라 그 방향의 해석을 얹을 자료가 못 됩니다.
학습 효과는 측정하지 않았습니다. 센 것은 빈도이고, 그 함정을 훈련했을 때 점수가 얼마나 오르는지는 이 자료에 들어 있지 않습니다.
데이터 정합성 검증에도 한 칸을 비워 둡니다. 이 파일은 영어 기출 데이터베이스이고 저희는 문항번호 41·42와 시행(6월모평·9월모평·수능)으로 필터해 36건씩을 얻었습니다. 다만 이 행들에 다른 영역 문항이 섞이지 않았는지는 별도로 검증하지 않았습니다. 확인한 것은 파일의 구조와 인코딩, 그리고 위 필터의 집계 결과까지입니다.
자료 출처
PodoTools 자체 태깅 데이터베이스 — gichul_e_db_enriched.csv (총 6,615행, BOM 포함)
이 글의 모든 수치는 아래 코드로 재현됩니다.
import pandas as pd
path = r"C:\WithNero\nero_tools\enriched\gichul_e_db_enriched.csv"
df = pd.read_csv(path, encoding="utf-8-sig") # BOM 있음 → utf-8-sig 필수
df.shape # (6615, ...)
정규 = ["6월모평", "9월모평", "수능"]
# 함정 유형 분포
for q in [41, 42]:
sub = df[(df["문항번호"] == q) & (df["시행"].isin(정규))]
print(q, len(sub), sub["함정유형"].value_counts())
# 배점 분포
for q in [41, 42]:
sub = df[(df["문항번호"] == q) & (df["시행"].isin(정규))]
print(q, sub["배점"].value_counts())
# 대분류·소분류
df[df["문항번호"].isin([41, 42])][["문항번호", "대분류", "소분류"]].drop_duplicates()
「함정유형」은 평가원 공식 분류가 아니라 코그닉스랩의 자체 태깅 라벨입니다. 「연도」 컬럼은 시행연도이며 학년도 표기로는 +1입니다.
이 글은 코그닉스랩의 자체 조사·집계로 작성되었습니다. 출처: 수능영어 41번과 42번 — 같은 지문인데 1위 함정이 다릅니다 — 코그닉스랩