고1 학력평가를 풀던 방식이 고3 수능까지 그대로 통할까. 학생이 실제로 부딪히는 질문은 대개 이 모양이다. 우리가 볼 수 있는 것은 풀이법이 아니라 기출 문항에 붙은 함정유형 태그였다. 그래서 2014~2025년 시행 영어 읽기 기출 중 함정유형 태그가 있는 3,760문항을 시험군 네 개로 나눠, 어떤 함정이 얼마나 자주 태깅됐는지 셌다. 결과는 두 줄로 요약된다. 1위는 바뀌지 않았다. 바뀐 것은 그 아래 두 라벨의 순서였다.
한눈에: 패러프레이즈함정은 고1 학평 40.4%에서 고3 수능·모평 36.3%까지 네 시험군 모두에서 1위였다. 키워드함정은 고1
고3 학평에서 14.115.3%를 오가다 고3 수능·모평군에서 12.1%로 낮아졌다. 지시어함정은 10.9%에서 13.4%로 계속 올랐고, 고3 수능·모평군에서 처음으로 키워드함정을 앞질렀다(13.4% > 12.1%). 같은 기간 문항 대분류 비중은 네 시험군에서 크게 다르지 않았다. 다만 앞의 세 군은 교육청 학력평가이고 마지막 군은 평가원 시험이라, 학년의 변화와 출제 주체의 변화를 이 데이터로 분리할 수 없다. 이 수치는 문항 태깅 빈도이지 학생 오답률이 아니며, 순위가 뒤바뀐 원인은 이 데이터로 설명되지 않는다.
무엇을 어떻게 세었나
자료는 하나다. cognixlab 자체 영어 기출 enriched DB(gichul_e_db_enriched.csv, 2014~2025 시행연도 6,615문항). 이 파일에서 함정유형 태그는 영어 읽기 문항에만 붙어 있다. 듣기 2,499문항은 태깅 대상이 아니고, 읽기 4,116문항 가운데 태그가 있는 문항은 3,760개(91.4%)다. 이 글은 그 3,760문항만 다룬다. 국어는 포함하지 않았다.
시행 회차는 네 시험군으로 묶었다. 앞의 세 군은 시·도교육청 학력평가이고, 마지막 군은 한국교육과정평가원이 출제하는 6월 모평·9월 모평·수능이다. 즉 마지막 군으로 넘어갈 때는 학년만이 아니라 출제 주체와 시험의 성격도 함께 바뀐다.
| 시험군 | 묶은 회차 | 출제 주체 | 읽기 문항 수 | 함정유형 태깅 문항 수 | 태깅률 |
|---|---|---|---|---|---|
| 고1 학평 | 고1 학력평가 회차 | 교육청 | 896 | 817 | 91.2% |
| 고2 학평 | 고2 학력평가 회차 | 교육청 | 896 | 790 | 88.2% |
| 고3 학평 | 고3 학력평가 회차 | 교육청 | 1,316 | 1,145 | 87.0% |
| 고3 수능·모평 | 6월 모평 + 9월 모평 + 수능 | 평가원 | 1,008 | 1,008 | 100.0% |
| 합계 | 4,116 | 3,760 | 91.4% |
계산은 파이썬(pandas)으로 했다. 함정유형이 비어 있지 않은 행만 남기고 pd.crosstab(시험군, 함정유형, normalize='index')로 시험군 안에서 각 라벨이 차지하는 비중(%)을 구했다. 문항 대분류도 같은 방식으로 셌다.
이 글의 숫자를 읽는 법
- 비중 — 해당 시험군에서 함정유형 태그가 붙은 문항 가운데 특정 라벨이 붙은 문항의 비율. 분모는 시험군별 태깅 문항 수(817·790·1,145·1,008)다.
- 라벨 이름 — 「패러프레이즈함정」「키워드함정」「지시어함정」은 DB에 적힌 라벨을 그대로 옮긴 것이다. 이 글에서 라벨의 뜻을 새로 풀이하지는 않는다.
- 순위·역전 — 태깅된 문항 집계에서 라벨 사이의 순서를 말한다. 학생 개인의 성적이나 오답과는 다른 층위다.
1위는 네 시험군 모두 패러프레이즈함정
| 시험군 | 패러프레이즈함정 | 비중 |
|---|---|---|
| 고1 학평 | 330 / 817 | 40.4% |
| 고2 학평 | 308 / 790 | 39.0% |
| 고3 학평 | 438 / 1,145 | 38.3% |
| 고3 수능·모평 | 366 / 1,008 | 36.3% |
비중은 고1 학평에서 고3 수능·모평으로 가면서 40.4%에서 36.3%로 4.1%p 낮아졌다. 그래도 네 시험군 모두에서 1위였다. 태깅된 문항 열 개 중 네 개 가까이에 이 라벨이 붙어 있다는 구도는 고1 학평부터 수능까지 유지됐다.
키워드함정은 내려가고 지시어함정은 올라갔다
두 라벨을 나란히 놓으면 이렇다.
| 시험군 | 키워드함정 | 지시어함정 | 차이(키워드 − 지시어) |
|---|---|---|---|
| 고1 학평 | 15.3% (125/817) | 10.9% (89/817) | +4.4%p |
| 고2 학평 | 14.1% (111/790) | 10.9% (86/790) | +3.2%p |
| 고3 학평 | 15.0% (172/1,145) | 12.1% (139/1,145) | +2.9%p |
| 고3 수능·모평 | 12.1% (122/1,008) | 13.4% (135/1,008) | −1.3%p |
두 흐름은 모양이 다르다. 키워드함정은 고1부터 고3 학평까지 14.1~15.3% 사이를 오가다가 고3 수능·모평군에서만 12.1%로 낮아졌다. 고3 학평(15.0%)과 비교하면 2.9%p 차이인데, 이 차이에 통계적 유의성 검정을 걸지는 않았다. 지시어함정은 고1과 고2가 10.9%로 같고, 고3 학평 12.1%, 고3 수능·모평 13.4%로 한 번도 내려가지 않았다.
그 결과 두 라벨 사이의 간격은 +4.4%p에서 +3.2%p, +2.9%p로 줄었고, 고3 수능·모평군에서 −1.3%p로 뒤집혔다. 네 시험군 가운데 지시어함정이 키워드함정보다 많이 태깅된 곳은 고3 수능·모평 하나뿐이다.
이 표만으로 말할 수 있는 범위는 여기까지다. 키워드함정이 왜 수능·모평군에서 줄었는지는 이 데이터로 설명되지 않는다. 특히 이 군은 앞의 세 군과 학년만 다른 것이 아니라 출제 주체가 교육청에서 평가원으로 바뀌는 자리라서, 「학년이 올라가며 생긴 변화」인지 「평가원과 교육청의 출제 차이」인지를 이 집계로는 가를 수 없다. 역전 역시 태깅된 문항 집계에서 순위가 교차했다는 사실일 뿐, 어느 학생의 성적이 어떻게 변했는지나 무엇이 무엇의 원인인지를 증명하지 않는다.
문항 유형 구성은 네 시험군이 비슷했다
함정 라벨의 순서가 바뀐 구간에서 문항 유형 구성도 크게 달라졌을까. 같은 3,760문항을 대분류별로 세면, 네 시험군의 비중은 아래 범위 안에 있었다.
| 대분류 | 네 시험군의 비중 범위 |
|---|---|
| 간접쓰기 | 21.4 ~ 22.8% |
| 대의파악 | 21.4 ~ 23.4% |
| 추론 | 17.8 ~ 19.2% |
| 세부정보 | 14.3 ~ 15.7% |
| 장문독해 | 10.1 ~ 14.3% |
| 어법어휘 | 9.9 ~ 10.7% |
여섯 대분류의 비중은 시험군끼리 크게 다르지 않았다. 범위가 가장 넓은 장문독해도 4.2%p 차이다. 다만 이 표는 유형 구성 비율만 비교한 것이다. 같은 대분류 안에서 소분류 구성이나 난이도, 지문 길이, 선택지 설계가 같다는 뜻은 아니다. 따라서 「구성이 비슷하니 함정 순서가 바뀐 원인은 다른 데 있다」는 결론도 이 표에서 끌어낼 수 없다.
이 데이터가 말하지 않는 것
- 학생 오답률이 아니다. 모든 수치는 문항에 붙은 태그의 빈도다. 태그 비중이 오른 함정에서 학생들이 실제로 더 많이 틀렸는지는 이 글의 수치로 알 수 없다. DB의 오답률 컬럼은 평가원 주관 시험 1,620문항 중 135문항(전체 6,615문항의 2.0%)에만 채워져 있어 분석에 쓰지 않았다.
- 태깅률이 시험군마다 다르다. 읽기 문항 중 태그가 붙은 비율은 고1 학평 91.2%, 고2 학평 88.2%, 고3 학평 87.0%, 고3 수능·모평 100%다. 대분류별로도 장문독해는 76.9%, 대의파악은 95.9%로 차이가 난다. 태그가 붙지 않은 문항이 무작위로 빠졌는지는 확인하지 않았기 때문에, 태그가 붙은 문항의 선택 과정이 시험군별 비율 차이에 영향을 줬을 가능성은 배제할 수 없다.
- 학년 효과와 출제 주체 효과를 분리할 수 없다. 고3 수능·모평군은 학년뿐 아니라 출제 주체(교육청→평가원)와 시험 성격이 함께 바뀐 군이다. 이 글의 「네 시험군의 분포 차이」를 「학년 상승에 따른 변화」로 읽어서는 안 된다.
- 라벨의 정의를 원문으로 대조하지 않았다. 각 함정 라벨의 태깅 기준을 적은 코드북 원문은 이번 조사에서 찾아 열어 보지 못했다. 그래서 이 글은 라벨 이름을 옮기기만 하고 뜻을 풀이하지 않았다.
- 영어 읽기만 다뤘다. 듣기 문항에는 함정유형 태그가 없고, 국어는 이 파일의 함정유형 집계에 들어 있지 않다.
정리
cognixlab 영어 기출 DB에서 함정유형 태그가 있는 3,760문항을 네 시험군으로 세면 두 가지가 보인다. 패러프레이즈함정은 고1 학평부터 수능·모평까지 1위였다. 그 아래에서는 키워드함정이 고3 수능·모평군에서 낮아지고, 계속 오르던 지시어함정이 이를 처음 앞질렀다. 이 관측은 태깅 빈도의 순서가 바뀌었다는 데까지만 말한다. 그 변화가 학년 때문인지 출제 주체 때문인지, 왜 생겼는지, 학생의 점수와 어떤 관계인지는 이 데이터가 답하지 않는다.
이 글은 코그닉스랩의 자체 조사·집계로 작성되었습니다. 출처: 고1 학평과 수능, 영어 함정유형 1위는 같았다 — 달라진 건 키워드함정과 지시어함정의 순서 — 코그닉스랩