지능검사는 1등이 아니었다

HR Insight
2026.9.25

“우리의 선발 도구는 여전히 쓸모가 있다. 다만 예측 관계는 지금까지 생각해 온 것보다 상당히 약하다.” 미네소타대학교의 산업조직심리학자 폴 새킷(Paul R. Sackett)과 동료들이 2022년 11월 Journal of Applied Psychology 107권 11호에 발표한 논문 「인사선발 타당도의 메타분석 추정치 재검토」의 결론입니다. 이 논문이 흔든 것은 작은 각주가 아닙니다. 채용 교과서가 25년 가까이 첫 장에 실어 온 숫자, 즉 인지능력검사가 직무성과를 가장 잘 예측하며 그 타당도가 .51이라는 명제입니다. 새킷 연구진이 범위제한 교정 방식을 다시 계산한 결과 이 값은 .31로 내려앉았고, 1위 자리는 타당도 .42의 구조화 면접에 넘어갔습니다. 이 글은 무엇이 어떻게 바뀌었는지, 왜 그런 일이 벌어졌는지, 그리고 진단과 채용을 설계하는 실무자가 내일부터 무엇을 달리해야 하는지를 정리한 것입니다.

25년을 지탱한 숫자 하나

출발점은 1998년입니다. 프랭크 슈미트(Frank Schmidt)와 존 헌터(John Hunter)가 그해 발표한 요약은 인사선발 분야에서 가장 많이 인용된 문헌 가운데 하나가 되었습니다. 이 요약에서 평균 타당도가 .50을 넘는 도구는 셋이었습니다. 작업표본검사 .54, 일반 인지능력 .51, 구조화 면접 .51입니다. 그 아래로 직무지식검사 .48, 정직성검사 .41이 이어졌습니다.

이 표는 단순한 순위가 아니라 하나의 사고방식을 만들어 냈습니다. 인지능력을 중심 예측 변수로 놓고, 나머지 도구는 “인지능력 위에 얼마나 더 설명력을 보태는가”라는 증분타당도의 관점에서 평가하는 방식입니다. 실무에서도 같은 논리가 작동했습니다. 대규모 공채에서 인적성검사를 1차 관문에 두고, 면접은 그 뒤에 배치하는 구조가 자연스럽게 정당화되었습니다. 면접은 어차피 주관적이니 객관적인 검사로 먼저 거르자는 논리 역시 이 숫자에 기대고 있었습니다.

2022년의 재계산은 그 토대를 다시 깝니다. 새킷 연구진이 제시한 상위 다섯 개 도구는 구조화 면접 .42, 직무지식검사 .40, 경험적으로 키를 잡은 바이오데이터 .38, 작업표본검사 .33, 그리고 인지능력검사와 정직성검사가 .31로 공동 5위입니다. 흥미로운 것은 얼굴들이 크게 바뀌지 않았다는 점입니다. 슈미트와 헌터의 상위 다섯 개가 모두 새 목록에도 남아 있습니다. 바뀐 것은 순서와 크기입니다. 저자들의 표현을 빌리면, 이전 상위 다섯 개의 평균은 .49였고 지금 상위 다섯 개의 평균은 .37입니다.

범위제한 교정, 무엇이 문제였나

왜 이런 차이가 생겼을까요. 답은 통계 처리의 한 단계인 범위제한 교정에 있습니다. 개념 자체는 어렵지 않습니다.

어떤 검사의 타당도를 재려면 검사 점수와 이후 성과를 짝지어 봐야 합니다. 그런데 회사는 검사 점수가 낮은 지원자를 이미 떨어뜨렸습니다. 합격자만 남은 집단에서는 점수의 폭이 좁아지고, 폭이 좁아지면 상관계수는 실제보다 작게 나옵니다. 그래서 연구자들은 “만약 지원자 전체를 다 뽑았다면 얼마였을까”를 역산해 값을 올려 줍니다. 이 보정 자체는 1903년 피어슨까지 거슬러 올라가는 정당한 절차입니다.

문제는 그 보정을 어떤 연구에 적용했는가입니다. 타당도 연구에는 두 종류가 있습니다. 하나는 지원자에게 검사를 실시하고 채용한 뒤 성과를 추적하는 예측타당도 설계입니다. 여기서는 검사가 실제 선발에 쓰였으니 범위가 좁아지는 일이 분명히 일어납니다. 다른 하나는 이미 일하고 있는 재직자에게 검사를 실시해 현재 성과와 대조하는 동시타당도 설계입니다. 이 경우 검사는 애초에 선발에 쓰이지 않았으므로 범위 축소가 거의 일어나지 않습니다.

새킷 연구진이 지적한 것은 기존 메타분석들이 이 둘을 구분하지 않고, 예측 설계에서 얻은 큰 보정값을 동시 설계 연구에도 똑같이 적용해 왔다는 점입니다. 그러면 원래 부풀릴 필요가 없는 값까지 함께 부풀려집니다. 그리고 실제 데이터베이스에서 동시 설계가 차지하는 비중은 압도적이었습니다. 작업표본 메타분석의 98%, 상황판단검사 메타분석의 95%, 정직성검사의 76%, 면접의 74%, 유럽 인지능력 연구의 78%, 미국 직업적성검사총집 자료의 80%가 동시 설계였습니다.

구조화 면접의 경우를 따라가 보면 수치가 어떻게 커졌는지 그대로 보입니다. 1994년 메타분석의 관측 타당도는 .28이었습니다. 성과평정의 측정오차를 보정하자 .37이 되었고, 여기에 범위제한을 보정하자 .51이 되었습니다. 마지막 한 단계가 값을 38% 끌어올린 것입니다. 새킷 연구진은 이 마지막 보정의 근거가 된 자료가 245편 중 14편에서 뽑은 값이며, 예측과 동시 설계의 비율조차 보고되지 않았다는 점을 들어 이를 채택하지 않았습니다.

“우리 스스로도 이 접근들을 연구에서 잘못 사용했고, 과거 논문에서 인용했으며, 학생들에게 가르쳤다는 점을 인정한다.”
Sackett, Zhang, Berry & Lievens (2022), Journal of Applied Psychology 107권 11호

이 자기 고백은 이 논문의 성격을 잘 보여 줍니다. 특정 학파를 공격하는 글이 아니라, 분야 전체가 공유해 온 관행을 저자 자신을 포함해 재검토한 글입니다. 저자들은 “우리도 더 좋은 소식을 전하고 싶다”면서도, 현실을 있는 그대로 보는 편이 낫다고 썼습니다.

가장 많이 깎인 도구, 오히려 오른 도구

변화 폭이 .05 이상인 도구를 큰 순서대로 보면 그림이 분명해집니다.

가장 크게 내려간 것은 작업표본검사로 .54에서 .33이 되었습니다. 낙폭 .21입니다. 다만 이것은 범위제한 때문만은 아닙니다. 기존 값이 메타분석 기법이 자리 잡기 전인 1974년의 서술적 리뷰에 기대고 있었던 탓이 큽니다. 새 근거인 2005년 메타분석은 54편 중 53편이 동시 설계였고, 관측 타당도 .26을 측정오차만 보정해 .33을 얻었습니다.

다음이 인지능력검사로 .51에서 .31입니다. 낙폭 .20이며, 저자들은 이 경우 감소의 주된 동력이 범위제한 추정치의 수정이라고 분명히 밝힙니다. 비구조화 면접은 .38에서 .19로 절반이 되었습니다. 그 밖에 성실성이 .31에서 .19로, 경력 연수가 .18에서 .07로, 정직성검사가 .41에서 .31로, 구조화 면접이 .51에서 .42로, 직무지식검사가 .48에서 .40으로, 평가센터가 .37에서 .29로 내려갔습니다.

반대로 오른 것도 있습니다. 직업흥미가 .10에서 .24로 올랐습니다. 이는 보정 방식이 아니라 개념을 다시 잡은 결과입니다. 예전에는 특정 흥미 차원이 직무 전반에서 성과를 예측하는지를 물었지만, 새 추정치는 개인의 흥미와 그 직무가 얼마나 맞는지를 재는 적합도 지수에 기초합니다. 무엇을 재느냐를 바꾸자 값이 달라진 셈입니다. 맥락을 넣은 성격검사가 일반 성격검사보다 높게 나온 것도 같은 계열의 발견입니다. “나는 꼼꼼한 편이다”가 아니라 “나는 직장에서 꼼꼼한 편이다”라고 물으면 예측력이 올라갑니다.

새 상위권의 공통점도 눈여겨볼 만합니다. 구조화 면접, 직무지식검사, 경험 기반 바이오데이터, 작업표본은 모두 그 직무에 특수한 측정입니다. 반면 인지능력, 정직성, 정서지능처럼 보다 일반적인 심리 구성개념은 그 아래에 자리합니다. 저자들은 이를 두고 예측 도구와 성과 사이의 행동적 유사성이 클수록 예측이 잘 된다는 오래된 원리, 곧 표징보다 표본이 낫다는 관점의 재확인이라고 설명합니다. 지원자가 실제로 할 일에 가까운 것을 시켜 볼수록 잘 맞힌다는 뜻입니다.

평균이 아니라 바닥을 보라

이 논문이 실무에 주는 가장 값진 정보는 사실 순위표가 아닙니다. 슈미트와 헌터의 요약은 평균 타당도만 제시했지만, 새킷 연구진은 편차를 함께 실었습니다.

선발 도구 다섯 가지의 평균 타당도와 80% 신뢰구간 하한을 구간 막대로 비교한 인포그래픽. 구조화 면접은 평균 .42로 가장 높지만 하한은 .18로 가장 낮고, 바이오데이터는 평균 .38에 하한 .26으로 가장 안정적이다
평균이 가장 높은 도구가 가장 안전한 도구는 아닙니다. 구조화 면접은 평균 .42로 1위지만 조직에 따라 .18까지 내려갈 수 있고, 바이오데이터는 평균은 낮아도 바닥이 .26으로 가장 높습니다.

구조화 면접을 예로 들겠습니다. 평균은 .42로 가장 높지만, 연구 간 잔차 표준편차가 .19로 상당히 큽니다. 이를 반영한 80% 신뢰구간의 하한은 .18입니다. 다시 말해 평균은 높아도 어떤 조직에서는 훨씬 낮은 값이 나올 위험이 함께 큽니다. 후속 논문에서 저자들은 이를 “구조화 면접의 타당도는 .42 플러스마이너스 .24로 보아야 한다”고 표현했습니다.

그래서 순위를 평균이 아니라 하한으로 다시 매기면 얼굴이 바뀝니다. 하한 기준 상위 다섯은 경험 기반 바이오데이터 .26, 맥락화된 성실성 .25, 직무지식검사 .23, 작업표본검사 .21, 구조화 면접 .18입니다. 평균 기준 상위권에 있던 인지능력검사와 정직성검사가 빠지고, 맥락화된 성실성이 들어옵니다. 위험을 피하고 싶은 조직이라면 평균이 가장 높은 도구가 아니라 바닥이 가장 높은 도구를 고르는 편이 합리적일 수 있다는 뜻입니다.

실무자에게 이 숫자가 뜻하는 바는 분명합니다. 메타분석의 평균값은 우리 회사에서 그대로 재현되리라는 약속이 아닙니다. 저자들도 “개별 고용주는 평균값이 자기 조직에 적용되리라고 믿어서는 안 된다”고 못 박습니다. 편차가 큰 도구일수록 도입 후 자체 검증이 더 중요해집니다. 구조화 면접을 쓰기로 했다면, 그 면접이 우리 조직에서 실제로 성과를 예측하는지 1년 뒤 성과 데이터와 대조해 보는 절차가 따라붙어야 합니다.

이 결론은 확정된 정설이 아니다

균형을 위해 반드시 덧붙여야 할 것이 있습니다. 이 재계산은 학계에서 논쟁 중인 주장입니다.

오현 등의 연구진은 2023년 Industrial and Organizational Psychology에 실은 논평에서 새킷 연구진의 전제 자체를 문제 삼았습니다. 동시타당도 설계라고 해서 범위제한이 무시할 만한 수준이라고 단정할 수 없다는 것입니다. 재직자 집단도 과거의 어떤 선발 절차를 통과한 사람들이므로, 현재 검사와 과거 선발 기준 사이의 상관이 충분히 높다면 범위 축소는 실제로 일어납니다. 이들은 새킷 연구진이 사용한 보정 방식의 선택과 직무 복잡도를 통제하지 않은 점도 함께 지적했습니다. 새킷 연구진은 이에 대해 다시 반론을 냈고, 논쟁은 이어지고 있습니다.

그러므로 “인지능력검사는 쓸모없다”로 읽는 것은 과장입니다. 저자들 자신이 인지능력검사가 여전히 유용한 국면을 지목합니다. 교육훈련 성과를 예측할 때, 전형적 수행이 아니라 최대 수행을 볼 때, 과업 수행 자체를 예측할 때가 그렇습니다. 또한 지원자가 사전 지식이나 경험을 갖추고 있지 않아도 쓸 수 있다는 장점은 그대로입니다. 작업표본이나 직무지식검사는 이미 그 일을 해 본 사람에게만 의미가 있지만, 인지능력검사는 앞으로 배울 사람에게도 쓸 수 있습니다. 신입 공채와 경력 채용에서 도구 구성이 달라져야 하는 이유이기도 합니다.

다만 논쟁의 어느 편에 서든 실무자가 가져갈 함의는 크게 흔들리지 않습니다. 교과서에 실린 하나의 숫자를 근거로 특정 도구에 선발 의사결정을 몰아주는 방식이 위태롭다는 점, 그리고 우리 조직의 데이터로 검증하지 않은 타당도는 빌려 온 값일 뿐이라는 점입니다.

도구 하나가 아니라 조합을 설계하라

후속 논문에서 새킷 연구진은 새 추정치가 선발 시스템 설계에 어떤 변화를 요구하는지를 구체적으로 계산했습니다. 인지능력, 성실성, 바이오데이터, 구조화 면접, 정직성검사, 상황판단검사 여섯 가지를 조합한 경우입니다.

새 추정치로 계산하면 이 조합의 타당도는 .61입니다. 여기서 인지능력검사의 가중치를 0으로 두어 아예 빼면 .56이 됩니다. 손실은 .05에 그칩니다. 반면 과거의 추정치로 같은 계산을 하면 손실이 .20에 달했습니다. 이 차이는 실무적으로 매우 큽니다. 지금까지 인지능력검사를 유지해 온 논거 가운데 하나는 “대체하기에는 예측력 손실이 너무 크다”는 것이었는데, 새 숫자에서는 그 논거가 약해지기 때문입니다.

동시에 조합의 힘도 확인됩니다. 단일 도구의 최고값이 .42인데 여섯 개를 조합하면 .61입니다. 도구들이 서로 다른 것을 재기 때문입니다. 실제로 이들 사이의 상관은 대체로 낮습니다. 저자들이 참조한 자료에서 주요 선발 도구 사이의 범위제한 보정 상관 가운데 가장 높은 값이 .37이었습니다. 인지 부하가 큰 도구끼리는 좀 더 높게 묶이지만, 인지 영역과 비인지 영역 사이의 상관은 작습니다. 성격검사와 인지능력검사의 평균 상관은 .10 언저리입니다.

여기서 타당도와 다양성의 관계도 다시 계산됩니다. 새킷 연구진은 각 도구별로 미국 흑인과 백인 응시자의 평균 점수 차이를 함께 제시했습니다. 인지능력검사가 .79로 가장 크고, 작업표본 .67, 직무지식 .54, 평가센터 .52가 뒤를 잇습니다. 반면 구조화 면접은 .23, 바이오데이터는 .33, 정직성검사는 .10으로 훨씬 작습니다. 새 상위 다섯 가운데 셋은 집단 차이가 크고 셋은 작다는 뜻입니다.

이 수치를 한국 조직에 옮길 때는 주의가 필요합니다. 이것은 미국의 인종 집단 간 평균 차이이며, 한국의 채용 현장에서 문제가 되는 축은 대체로 다릅니다. 성별, 출신 학교, 연령, 전공 같은 변수가 그렇습니다. 따라서 이 표에서 그대로 가져올 것은 개별 숫자가 아니라 원리입니다. 예측력이 비슷한 도구들 사이에서 특정 집단에 불리하게 작용하는 정도가 다르다면, 그 차이는 도구 선택의 근거가 된다는 원리입니다. 그리고 우리 조직의 집단 간 점수 차이는 우리 데이터로만 알 수 있습니다.

진단과 채용 설계를 어디서부터 고칠 것인가

정리하면 실행 과제는 세 층위로 나뉩니다.

첫째는 면접의 구조화입니다. 이 논문에서 가장 극적인 대비는 구조화 면접 .42와 비구조화 면접 .19입니다. 같은 이름을 달고 있지만 예측력은 두 배 이상 차이가 납니다. 구조화란 질문을 미리 정해 모든 지원자에게 동일하게 묻고, 평가 기준과 척도를 사전에 정의하며, 면접관이 개별 항목을 기록한 뒤 종합하는 절차를 말합니다. 면접실에서 자유롭게 대화하고 인상으로 점수를 매기는 방식은 .19짜리 도구입니다. 새 검사를 도입하는 것보다 이미 하고 있는 면접의 절차를 고치는 편이 비용 대비 효과가 큽니다.

둘째는 직무 특수성의 확보입니다. 상위권을 차지한 도구들의 공통점이 직무에 특수한 측정이라면, 범용 문항 세트를 모든 직무에 동일하게 적용하는 관행은 예측력을 스스로 깎는 선택입니다. 같은 역량 모델을 쓰더라도 행동 예시와 상황 문항은 해당 직무의 실제 장면에서 뽑아야 합니다. 진단 도구를 운영하는 입장에서 이는 문항 은행을 직무군별로 분기시키는 작업을 뜻합니다.

셋째는 자체 검증의 제도화입니다. 편차가 크다는 사실이 확인된 이상, 외부 타당도 수치를 인용하는 것으로 도입 근거를 삼는 방식은 더 이상 충분하지 않습니다. 선발 점수를 보관하고, 1년 뒤 성과 데이터와 연결해 상관을 확인하고, 그 결과를 다음 해 도구 구성에 반영하는 순환이 필요합니다. 이 작업은 통계 전문가가 없어도 시작할 수 있습니다. 필요한 것은 정교한 모형이 아니라 점수를 버리지 않고 쌓아 두는 습관입니다. 대부분의 조직이 검증을 못 하는 이유는 분석 역량이 없어서가 아니라 작년 지원자의 검사 점수가 남아 있지 않아서입니다.

HR 담당자를 위한 시사점

  • 면접을 없애지 말고 구조화하십시오: 구조화 면접 .42와 비구조화 면접 .19의 차이는 도구의 차이가 아니라 절차의 차이입니다. 질문 고정, 기준 사전 정의, 항목별 기록 세 가지만 지켜도 같은 시간에 두 배의 정보를 얻습니다.
  • 인적성검사를 1차 관문에 두는 구조를 재검토하십시오: 인지능력검사의 예측력이 .31이라면, 이 관문에서 걸러진 사람 가운데 상당수는 뒤 단계에서 높은 점수를 받았을 사람입니다. 순서를 바꾸거나 통과 기준을 완화하는 것만으로 후보군의 폭이 달라집니다.
  • 단일 도구가 아니라 조합으로 설계하십시오: 최고의 단일 도구가 .42인데 여섯 개 조합은 .61입니다. 도구들이 서로 다른 것을 재기 때문이며, 주요 도구 사이의 상관은 가장 높아도 .37 수준입니다.
  • 평균 옆에 편차를 함께 적으십시오: 구조화 면접은 평균 .42에 80% 신뢰구간 하한 .18입니다. 도입 검토 문서에 평균만 인용하면 위험을 숨기는 것입니다. 안정성을 중시한다면 하한이 높은 도구를 우선하십시오.
  • 범용 문항을 직무별로 분기시키십시오: 새 상위권은 모두 직무 특수적 측정입니다. 같은 역량이라도 행동 예시와 상황 문항을 해당 직무의 장면에서 가져올수록 예측력이 올라갑니다.
  • 성격 문항에 맥락을 넣으십시오: 일반 성격검사보다 직장 맥락을 명시한 문항의 예측력이 더 높습니다. 맥락화된 성실성은 하한 기준 순위에서 2위에 올라 있습니다.
  • 지원자 점수를 폐기하지 말고 보관하십시오: 자체 검증을 막는 것은 분석 역량이 아니라 데이터의 부재입니다. 선발 점수와 1년 뒤 성과를 연결할 수 있게 식별자를 남겨 두는 것이 첫 단계입니다.
  • 집단 간 점수 차이는 우리 데이터로 확인하십시오: 논문의 흑인과 백인 평균 차이는 미국 맥락의 수치입니다. 한국에서는 성별, 연령, 출신 학교 같은 축에서 같은 점검을 우리 데이터로 수행해야 의미가 있습니다.

이 논문이 남기는 메시지는 선발 도구를 버리라는 것이 아닙니다. 저자들의 표현대로 도구는 여전히 유효하고, 다만 우리가 기대해 온 만큼은 아니라는 것입니다. 그동안 채용 제도를 정당화해 온 숫자의 상당 부분이 보정 과정에서 만들어진 것이었다면, 이제 근거를 다시 쌓아야 할 곳은 학술지가 아니라 각자의 조직입니다. 빌려 온 타당도는 언제든 다시 계산될 수 있지만, 우리 조직의 데이터로 확인한 타당도는 그렇지 않습니다.

참고 자료