고1 학평과 수능, 영어 함정유형 1위는 같았다달라진 건 키워드함정과 지시어함정의 순서

영어연구소


고1 학력평가를 풀던 방식이 고3 수능까지 그대로 통할까. 학생이 실제로 부딪히는 질문은 대개 이 모양이다. 우리가 볼 수 있는 것은 풀이법이 아니라 기출 문항에 붙은 함정유형 태그였다. 그래서 2014~2025년 시행 영어 읽기 기출 중 함정유형 태그가 있는 3,760문항을 시험군 네 개로 나눠, 어떤 함정이 얼마나 자주 태깅됐는지 셌다. 결과는 두 줄로 요약된다. 1위는 바뀌지 않았다. 바뀐 것은 그 아래 두 라벨의 순서였다.

한눈에: 패러프레이즈함정은 고1 학평 40.4%에서 고3 수능·모평 36.3%까지 네 시험군 모두에서 1위였다. 키워드함정은 고1고3 학평에서 14.115.3%를 오가다 고3 수능·모평군에서 12.1%로 낮아졌다. 지시어함정은 10.9%에서 13.4%로 계속 올랐고, 고3 수능·모평군에서 처음으로 키워드함정을 앞질렀다(13.4% > 12.1%). 같은 기간 문항 대분류 비중은 네 시험군에서 크게 다르지 않았다. 다만 앞의 세 군은 교육청 학력평가이고 마지막 군은 평가원 시험이라, 학년의 변화와 출제 주체의 변화를 이 데이터로 분리할 수 없다. 이 수치는 문항 태깅 빈도이지 학생 오답률이 아니며, 순위가 뒤바뀐 원인은 이 데이터로 설명되지 않는다.

무엇을 어떻게 세었나

자료는 하나다. cognixlab 자체 영어 기출 enriched DB(gichul_e_db_enriched.csv, 2014~2025 시행연도 6,615문항). 이 파일에서 함정유형 태그는 영어 읽기 문항에만 붙어 있다. 듣기 2,499문항은 태깅 대상이 아니고, 읽기 4,116문항 가운데 태그가 있는 문항은 3,760개(91.4%)다. 이 글은 그 3,760문항만 다룬다. 국어는 포함하지 않았다.

시행 회차는 네 시험군으로 묶었다. 앞의 세 군은 시·도교육청 학력평가이고, 마지막 군은 한국교육과정평가원이 출제하는 6월 모평·9월 모평·수능이다. 즉 마지막 군으로 넘어갈 때는 학년만이 아니라 출제 주체와 시험의 성격도 함께 바뀐다.

시험군묶은 회차출제 주체읽기 문항 수함정유형 태깅 문항 수태깅률
고1 학평고1 학력평가 회차교육청89681791.2%
고2 학평고2 학력평가 회차교육청89679088.2%
고3 학평고3 학력평가 회차교육청1,3161,14587.0%
고3 수능·모평6월 모평 + 9월 모평 + 수능평가원1,0081,008100.0%
합계4,1163,76091.4%

계산은 파이썬(pandas)으로 했다. 함정유형이 비어 있지 않은 행만 남기고 pd.crosstab(시험군, 함정유형, normalize='index')로 시험군 안에서 각 라벨이 차지하는 비중(%)을 구했다. 문항 대분류도 같은 방식으로 셌다.

이 글의 숫자를 읽는 법

  • 비중 — 해당 시험군에서 함정유형 태그가 붙은 문항 가운데 특정 라벨이 붙은 문항의 비율. 분모는 시험군별 태깅 문항 수(817·790·1,145·1,008)다.
  • 라벨 이름 — 「패러프레이즈함정」「키워드함정」「지시어함정」은 DB에 적힌 라벨을 그대로 옮긴 것이다. 이 글에서 라벨의 뜻을 새로 풀이하지는 않는다.
  • 순위·역전 — 태깅된 문항 집계에서 라벨 사이의 순서를 말한다. 학생 개인의 성적이나 오답과는 다른 층위다.

1위는 네 시험군 모두 패러프레이즈함정

시험군패러프레이즈함정비중
고1 학평330 / 81740.4%
고2 학평308 / 79039.0%
고3 학평438 / 1,14538.3%
고3 수능·모평366 / 1,00836.3%

비중은 고1 학평에서 고3 수능·모평으로 가면서 40.4%에서 36.3%로 4.1%p 낮아졌다. 그래도 네 시험군 모두에서 1위였다. 태깅된 문항 열 개 중 네 개 가까이에 이 라벨이 붙어 있다는 구도는 고1 학평부터 수능까지 유지됐다.

키워드함정은 내려가고 지시어함정은 올라갔다

두 라벨을 나란히 놓으면 이렇다.

시험군키워드함정지시어함정차이(키워드 − 지시어)
고1 학평15.3% (125/817)10.9% (89/817)+4.4%p
고2 학평14.1% (111/790)10.9% (86/790)+3.2%p
고3 학평15.0% (172/1,145)12.1% (139/1,145)+2.9%p
고3 수능·모평12.1% (122/1,008)13.4% (135/1,008)−1.3%p

두 흐름은 모양이 다르다. 키워드함정은 고1부터 고3 학평까지 14.1~15.3% 사이를 오가다가 고3 수능·모평군에서만 12.1%로 낮아졌다. 고3 학평(15.0%)과 비교하면 2.9%p 차이인데, 이 차이에 통계적 유의성 검정을 걸지는 않았다. 지시어함정은 고1과 고2가 10.9%로 같고, 고3 학평 12.1%, 고3 수능·모평 13.4%로 한 번도 내려가지 않았다.

그 결과 두 라벨 사이의 간격은 +4.4%p에서 +3.2%p, +2.9%p로 줄었고, 고3 수능·모평군에서 −1.3%p로 뒤집혔다. 네 시험군 가운데 지시어함정이 키워드함정보다 많이 태깅된 곳은 고3 수능·모평 하나뿐이다.

이 표만으로 말할 수 있는 범위는 여기까지다. 키워드함정이 왜 수능·모평군에서 줄었는지는 이 데이터로 설명되지 않는다. 특히 이 군은 앞의 세 군과 학년만 다른 것이 아니라 출제 주체가 교육청에서 평가원으로 바뀌는 자리라서, 「학년이 올라가며 생긴 변화」인지 「평가원과 교육청의 출제 차이」인지를 이 집계로는 가를 수 없다. 역전 역시 태깅된 문항 집계에서 순위가 교차했다는 사실일 뿐, 어느 학생의 성적이 어떻게 변했는지나 무엇이 무엇의 원인인지를 증명하지 않는다.

문항 유형 구성은 네 시험군이 비슷했다

함정 라벨의 순서가 바뀐 구간에서 문항 유형 구성도 크게 달라졌을까. 같은 3,760문항을 대분류별로 세면, 네 시험군의 비중은 아래 범위 안에 있었다.

대분류네 시험군의 비중 범위
간접쓰기21.4 ~ 22.8%
대의파악21.4 ~ 23.4%
추론17.8 ~ 19.2%
세부정보14.3 ~ 15.7%
장문독해10.1 ~ 14.3%
어법어휘9.9 ~ 10.7%

여섯 대분류의 비중은 시험군끼리 크게 다르지 않았다. 범위가 가장 넓은 장문독해도 4.2%p 차이다. 다만 이 표는 유형 구성 비율만 비교한 것이다. 같은 대분류 안에서 소분류 구성이나 난이도, 지문 길이, 선택지 설계가 같다는 뜻은 아니다. 따라서 「구성이 비슷하니 함정 순서가 바뀐 원인은 다른 데 있다」는 결론도 이 표에서 끌어낼 수 없다.

이 데이터가 말하지 않는 것

  • 학생 오답률이 아니다. 모든 수치는 문항에 붙은 태그의 빈도다. 태그 비중이 오른 함정에서 학생들이 실제로 더 많이 틀렸는지는 이 글의 수치로 알 수 없다. DB의 오답률 컬럼은 평가원 주관 시험 1,620문항 중 135문항(전체 6,615문항의 2.0%)에만 채워져 있어 분석에 쓰지 않았다.
  • 태깅률이 시험군마다 다르다. 읽기 문항 중 태그가 붙은 비율은 고1 학평 91.2%, 고2 학평 88.2%, 고3 학평 87.0%, 고3 수능·모평 100%다. 대분류별로도 장문독해는 76.9%, 대의파악은 95.9%로 차이가 난다. 태그가 붙지 않은 문항이 무작위로 빠졌는지는 확인하지 않았기 때문에, 태그가 붙은 문항의 선택 과정이 시험군별 비율 차이에 영향을 줬을 가능성은 배제할 수 없다.
  • 학년 효과와 출제 주체 효과를 분리할 수 없다. 고3 수능·모평군은 학년뿐 아니라 출제 주체(교육청→평가원)와 시험 성격이 함께 바뀐 군이다. 이 글의 「네 시험군의 분포 차이」를 「학년 상승에 따른 변화」로 읽어서는 안 된다.
  • 라벨의 정의를 원문으로 대조하지 않았다. 각 함정 라벨의 태깅 기준을 적은 코드북 원문은 이번 조사에서 찾아 열어 보지 못했다. 그래서 이 글은 라벨 이름을 옮기기만 하고 뜻을 풀이하지 않았다.
  • 영어 읽기만 다뤘다. 듣기 문항에는 함정유형 태그가 없고, 국어는 이 파일의 함정유형 집계에 들어 있지 않다.

정리

cognixlab 영어 기출 DB에서 함정유형 태그가 있는 3,760문항을 네 시험군으로 세면 두 가지가 보인다. 패러프레이즈함정은 고1 학평부터 수능·모평까지 1위였다. 그 아래에서는 키워드함정이 고3 수능·모평군에서 낮아지고, 계속 오르던 지시어함정이 이를 처음 앞질렀다. 이 관측은 태깅 빈도의 순서가 바뀌었다는 데까지만 말한다. 그 변화가 학년 때문인지 출제 주체 때문인지, 왜 생겼는지, 학생의 점수와 어떤 관계인지는 이 데이터가 답하지 않는다.

이 글은 코그닉스랩의 자체 조사·집계로 작성되었습니다. 출처: 고1 학평과 수능, 영어 함정유형 1위는 같았다 — 달라진 건 키워드함정과 지시어함정의 순서 — 코그닉스랩