“검사지 앞에서 사람은 더 성실해진다.” 이 문장은 과장이 아니라 메타분석의 요약입니다. 스콧 버클랜드(Scott Birkeland)와 동료들은 2006년 International Journal of Selection and Assessment에 실제 지원자와 비지원자의 성격검사 점수를 비교한 33편의 연구를 종합해 발표했습니다. 결과는 한 방향이었습니다. 지원자는 비지원자보다 성실성에서 0.45 표준편차, 정서적 안정성에서 0.44 표준편차 높은 점수를 받았습니다. 채용 현장에서 성격검사를 쓰는 조직이라면 누구나 한 번쯤 품는 의심, 즉 “지원자가 좋게 보이려고 답을 꾸미지 않을까”라는 질문에 대해 학계는 이미 수십 년째 답을 쌓아 왔습니다. 이 글은 그 답을 네 가지 질문으로 나눠 정리합니다. 얼마나 꾸미는가, 무엇을 꾸미는가, 그래서 검사가 쓸모없어지는가, 그리고 무엇을 바꾸면 줄어드는가입니다.
같은 사람에게 두 번 검사를 시키면
응답 왜곡을 측정하는 가장 깔끔한 방법은 같은 사람에게 두 번 검사를 치르게 하는 것입니다. 한 번은 실제로 지원할 때, 다른 한 번은 합격과 무관한 상황에서입니다. 두 점수의 차이가 곧 “지원이라는 상황이 만든 점수”입니다. 서로 다른 집단을 비교하면 집단 자체의 차이가 섞이지만, 같은 사람을 비교하면 그 문제가 사라집니다.
그리피스(Griffith)와 동료들은 2007년 Personnel Review에 바로 이 설계를 적용한 연구를 실었습니다. 실제 지원 과정에서 성격검사를 치른 사람들에게 나중에 다시 연락해, 이번에는 솔직하게 답해 달라는 지시와 함께 같은 검사를 다시 받게 했습니다. 연구진은 신뢰구간을 어떻게 잡느냐에 따라 지원자의 30%에서 50%가 지원 상황에서 점수를 끌어올렸다고 보고했습니다. 소수의 일탈이 아니라 상당한 비율의 지원자가 보이는 일반적 행동이라는 뜻입니다.
이런 설계의 연구가 쌓이자 메타분석도 나왔습니다. 후(Hu)와 브라이언 코널리(Brian Connelly)는 2021년 같은 학술지에 실제 지원자를 대상으로 한 개인 내 비교 연구 20편을 종합했습니다. 지원 상황의 평균은 부담 없는 상황보다 대략 절반 표준편차 높았고, 가장 크게 오른 요인은 역시 성실성으로 효과크기가 0.59였습니다. 버클랜드 연구진이 집단 간 비교로 얻은 0.45와 방법이 다른데도 같은 결론에 닿은 것입니다.
반 표준편차가 어느 정도인지 감을 잡아 보겠습니다. 점수가 정규분포를 따른다고 가정하면, 평소 딱 중간인 사람이 지원 상황에서 반 표준편차를 끌어올리면 상위 30% 언저리로 올라갑니다. 서류상으로는 같은 사람인데 검사 결과지 위에서는 전혀 다른 사람처럼 보이는 셈입니다.
부풀려지는 것은 ‘직무에 필요해 보이는’ 특성이다
흥미로운 것은 모든 요인이 똑같이 오르지 않는다는 점입니다. 버클랜드 연구진의 결과에서 외향성은 0.11, 개방성은 0.13 올랐습니다. 성실성과 정서적 안정성 상승 폭의 3분의 1에도 못 미칩니다. 지원자들이 아무 문항에서나 점수를 올리는 것이 아니라, 고용주가 원할 것이라고 짐작하는 특성을 골라 올린다는 뜻입니다. 대부분의 직무에서 “꼼꼼하고 책임감 있으며 감정 기복이 적은 사람”은 누구나 원하는 인물상이기 때문입니다.
이 해석을 뒷받침하는 결과가 직무별 분석에서 나왔습니다. 연구진은 영업직처럼 특정 직무에서는 요인별 상승 폭의 순위가 크게 달라진다는 것을 확인했습니다. 영업직 지원자에게 외향성은 “있으면 좋은 특성”이 아니라 “직무에 필요한 특성”으로 읽히기 때문입니다. 저자들은 이를 두고 지원자가 특히 직무와 관련 있다고 여겨지는 성격 차원에서 응답을 왜곡한다고 해석했습니다.
2019년 멍양 차오(Mengyang Cao)와 프리츠 드래스고(Fritz Drasgow)의 메타분석도 같은 현상을 다른 각도에서 확인했습니다.
“목표 직무와 관련성이 높은 성격 하위요인은 관련성이 낮은 하위요인보다 더 큰 점수 상승을 보였다.”
Cao & Drasgow (2019), Journal of Applied Psychology 104권 11호
실무적으로 이 사실은 불편한 역설을 만듭니다. 조직이 가장 중요하게 보려는 특성일수록 지원자도 가장 열심히 꾸밉니다. 채용 공고에 “꼼꼼함과 책임감을 갖춘 인재”라고 쓰는 순간, 그 조직의 성실성 점수는 변별력을 잃기 시작합니다. 역량 모델과 인재상을 공개하는 것은 투명성 측면에서 바람직하지만, 같은 문구가 검사 문항의 ‘정답지’ 역할을 할 수 있다는 점은 함께 고려해야 합니다.
그래도 검사는 여전히 예측한다는 반론
여기까지 읽으면 “그렇다면 채용에서 성격검사는 쓸모없다”는 결론으로 가기 쉽습니다. 그러나 학계의 또 다른 흐름은 정반대 결론을 내놓았습니다.
데니즈 원스(Deniz Ones)와 친 비스웨스바란(Chockalingam Viswesvaran), 라이스(Reiss)는 1996년 Journal of Applied Psychology에 사회적 바람직성 연구를 종합한 메타분석을 발표하며 제목에 ‘붉은 청어(red herring)’라는 표현을 썼습니다. 주의를 엉뚱한 곳으로 끄는 미끼라는 뜻입니다. 연구진은 사회적 바람직성 척도, 즉 “좋게 보이려는 경향”을 재는 척도가 직무성과, 과업성과, 반생산적 행동을 예측하지 못한다는 것을 확인했습니다. 그리고 성격 5요인 점수에서 사회적 바람직성의 영향을 통계적으로 걷어내도 직무성과에 대한 예측 타당도는 그대로 유지된다고 보고했습니다.
후와 코널리의 2021년 메타분석에도 이 반론을 지지하는 대목이 있습니다. 지원 상황에서 평균은 올랐지만, 점수의 변산은 약간 줄었을 뿐이고 사람들 사이의 순위 일관성은 오히려 더 강하게 나타났습니다. 모두가 비슷한 폭으로 점수를 올린다면, 누가 더 성실한지의 순서 자체는 크게 흔들리지 않는다는 해석이 가능합니다. 이 관점에서 보면 응답 왜곡은 저울의 영점이 조금 틀어진 것에 가깝습니다. 모든 사람의 무게가 똑같이 더해지면 비교에는 문제가 없습니다.
이 반론은 가볍게 넘길 수 없습니다. 성격검사를 선발에서 아예 배제하자는 주장은 이 증거들과 충돌합니다. 폴 새킷(Paul Sackett) 연구진이 2022년 Journal of Applied Psychology에 발표한 선발 도구 타당도 재분석에서도 맥락을 넣은 성실성 문항은 80% 신뢰구간 하한 기준으로 선발 도구 가운데 상위권에 올랐습니다. 성격 측정은 여전히 쓸 만한 정보를 줍니다.
문제는 평균이 아니라 합격선 근처에서 생긴다
그렇다면 두 흐름은 어떻게 화해할까요. 열쇠는 ‘집단 수준의 타당도’와 ‘개인 수준의 결정’을 구분하는 데 있습니다.
타당도는 수백 명 전체에 걸친 상관계수입니다. 모두가 비슷하게 점수를 올리면 상관계수는 크게 변하지 않습니다. 그러나 채용은 상관계수로 하지 않습니다. 합격선을 긋고 그 위와 아래를 가릅니다. 그리고 모든 사람이 똑같은 폭으로 점수를 올린다는 가정은 현실에서 성립하지 않습니다. 그리피스 연구의 30~50%라는 수치가 의미하는 바가 정확히 이것입니다. 누군가는 크게 올리고, 누군가는 전혀 올리지 않습니다.
그리피스 연구진은 바로 이 점을 확인했습니다. 응답 왜곡은 지원자들의 순위를 유의미하게 바꿨고, 그 변화는 실제 채용 결정에 영향을 미칠 만한 수준이었습니다. 다만 연구진은 성과 데이터가 없었기 때문에 타당도가 얼마나 떨어졌는지는 단정하지 않았다는 점을 스스로 밝혔습니다. 결론의 범위를 정확히 지킨 것입니다.
도노번(Donovan), 드와이트(Dwight), 슈나이더(Schneider)는 2014년 Journal of Business and Psychology에 입사 후 데이터까지 추적한 연구를 실었습니다. 제약회사 영업직에 지원한 162명에게 지원 시점과 입사 후에 같은 자기보고 검사를 실시하고, 교육 성과와 5개월 뒤의 영업 데이터를 함께 수집했습니다. 결과적으로 대략 절반이 적어도 한 개 차원에서 왜곡 응답자로 분류되었고, 응답 왜곡은 검사의 측정 특성과 채용 결정의 질을 모두 떨어뜨리는 방향으로 작용했습니다.
이 그림을 합격선에 대입해 보면 문제가 선명해집니다. 합격선 바로 아래에 있던 사람 중 점수를 크게 올린 사람은 위로 올라가고, 꾸미지 않은 사람은 그 자리에 머뭅니다. 결과적으로 합격선 근처에서는 실제 성격보다 ‘무엇이 정답인지 읽어 내는 능력’과 ‘그 정답을 쓸 의지’가 당락을 가르게 됩니다. 평균 타당도가 유지된다는 사실은 이 개인 수준의 불공정을 지워 주지 않습니다. 선발 비율이 낮을수록, 즉 소수만 뽑는 경쟁적인 채용일수록 이 효과는 커집니다. 합격선이 분포의 꼬리 쪽으로 이동할수록 꾸민 사람이 상위권에 몰릴 여지가 커지기 때문입니다.
형식을 바꾸면 줄어든다: 강제선택 문항
응답 왜곡을 줄이는 방법 가운데 가장 많이 연구된 것은 문항 형식 자체를 바꾸는 것입니다. 우리가 익숙한 성격검사는 대부분 단일 진술형입니다. “나는 맡은 일을 끝까지 해낸다”라는 문장 하나를 주고 1점부터 5점까지 동의 정도를 묻습니다. 이 형식에서는 모든 문항에 “매우 그렇다”를 고르는 데 아무 비용이 들지 않습니다.
강제선택형은 다릅니다. 비슷하게 바람직해 보이는 진술 여러 개를 한 묶음으로 제시하고, 그중 자신을 가장 잘 설명하는 것과 가장 덜 설명하는 것을 고르게 합니다. 예를 들어 “나는 맡은 일을 끝까지 해낸다”와 “나는 처음 만난 사람과도 쉽게 대화한다”가 한 묶음에 있다면, 둘 다 좋은 특성이지만 하나만 골라야 합니다. 모든 것을 높게 표시하는 전략이 원천적으로 막힙니다.
차오와 드래스고의 2019년 메타분석은 강제선택형 측정의 전체 점수 상승 효과크기를 0.06으로 추정했습니다. 그리고 선발 장면에서 강제선택형의 점수 상승은 대부분의 성격 하위요인에서 단일 진술형 측정의 메타분석 효과크기보다 훨씬 낮았다고 보고했습니다.
다만 “강제선택형이면 된다”로 끝나지는 않습니다. 같은 연구는 설계 방식에 따라 효과가 달라진다는 점을 강조합니다. 한 묶음 안의 진술들이 사회적 바람직성 수준에서 균형을 이룰 때, 그리고 응답을 규준 참조 방식으로 채점할 때 일관되게 왜곡에 더 강했습니다. 여러 진술 가운데 하나를 고르는 PICK 형식도 왜곡에 강한 편이었습니다. 반대로 묶음 안에 누가 봐도 더 좋아 보이는 진술이 섞여 있다면, 강제선택이라는 형식은 이름뿐입니다.
요인별 차이도 있습니다. 마르티네스(Martínez)와 헤수스 살가도(Jesús Salgado)가 2021년 Frontiers in Psychology에 발표한 메타분석은 52편의 문헌, 82개 독립 표본, 누적 10만 6,266명을 종합했습니다. 실제 지원 장면에서 정서적 안정성의 점수 상승은 단일 진술형이 0.34였던 반면 준입사적(quasi-ipsative) 강제선택형은 0.05에 그쳤습니다. 그러나 성실성에서는 단일 진술형 0.37, 준입사적 강제선택형 0.35로 차이가 거의 없었습니다. 형식이 모든 것을 해결해 주지는 않는다는 뜻입니다. 한편 저자들은 살가도의 이전 메타분석들을 인용해, 준입사적 강제선택형으로 측정한 성실성이 직무성과와 학업성과를 가장 잘 예측하는 성격 변수로 확인되었다고 정리합니다. 왜곡 저항성과 예측력을 함께 보면 여전히 가장 유력한 선택지라는 뜻입니다.
경고문, 조합, 그리고 용도의 분리
문항 형식 말고도 조직이 당장 쓸 수 있는 수단이 있습니다. 첫째는 경고문입니다. 드와이트와 도노번은 2003년 Human Performance에 발표한 연구에서, 검사 전에 제시하는 경고의 종류를 나눠 효과를 비교했습니다. 부정직한 응답을 탐지할 수 있다고 알리는 경고, 왜곡이 드러나면 어떤 결과가 따르는지 알리는 경고, 그리고 둘을 결합한 경고입니다. 이 가운데 탐지 가능성과 그 결과를 함께 알린 경고가 응답에 영향을 주었습니다. 단순히 “솔직하게 답해 주세요”라고 쓰는 것과는 다른 문장입니다.
다만 경고문은 양날의 검입니다. 지나치게 위협적인 경고는 지원자 경험을 해치고, 솔직하게 답하던 사람까지 긴장하게 만듭니다. 사실과 다른 탐지 능력을 암시하는 문구를 쓰는 것도 윤리적으로 문제가 됩니다. 조직이 실제로 운영하는 검증 절차, 예를 들어 응답 일관성 지표나 면접에서의 교차 확인이 있을 때에만 그 사실을 알리는 것이 바람직합니다.
둘째는 조합입니다. 성격검사를 단독 관문으로 쓰면 왜곡의 영향이 그대로 당락에 반영됩니다. 반면 구조화 면접, 작업표본, 상황판단 과제처럼 다른 방식의 도구와 함께 쓰면 한 도구의 왜곡이 전체 결정에 미치는 무게가 줄어듭니다. 특히 성격검사에서 높은 점수를 받은 특성을 면접에서 구체적인 행동 사례로 확인하는 방식은 비용이 적으면서도 효과적입니다. “책임감이 높다”는 결과가 나왔다면, 면접에서 “끝까지 책임지기 어려웠던 일을 끝까지 마무리한 경험”을 묻는 식입니다. 검사 결과를 합격 판정이 아니라 면접 질문을 설계하는 재료로 쓰는 것입니다.
셋째는 용도의 분리입니다. 같은 성격검사라도 선발용으로 쓸 때와 입사 후 개발용으로 쓸 때 응답자의 동기가 완전히 다릅니다. 앞서 본 개인 내 비교 연구들이 보여 주듯, 합격과 무관한 상황에서 사람들은 훨씬 덜 꾸밉니다. 그러므로 입사 후 리더십 진단이나 코칭용 성격 진단의 결과를 채용 당시 점수와 나란히 놓아 보는 것만으로도 조직은 자기 선발 도구가 얼마나 부풀려져 있었는지를 추정할 수 있습니다. 반대로 개발용 진단 결과가 인사 평가나 승진에 쓰인다는 신호가 퍼지는 순간, 그 진단도 선발 검사처럼 부풀려지기 시작합니다. 개발용 진단의 결과를 누가 보는지, 어디에 쓰이는지를 명확히 약속하고 지키는 것이 데이터의 질을 지키는 가장 확실한 방법입니다.
HR 담당자를 위한 시사점
- 지원자 점수와 재직자 점수를 같은 규준으로 읽지 마십시오: 지원 상황의 평균은 대략 반 표준편차 높습니다. 재직자 규준으로 지원자를 해석하면 거의 모든 지원자가 평균 이상으로 보입니다. 가능하다면 지원자 집단의 규준을 따로 만드십시오.
- 인재상 문구와 검사 문항이 겹치는지 점검하십시오: 직무와 관련 있어 보이는 특성일수록 더 많이 부풀려집니다. 채용 공고의 핵심 키워드가 검사 문항에 그대로 쓰여 있다면, 그 요인의 점수는 변별력을 잃었을 가능성이 큽니다.
- 강제선택형을 도입할 때는 설계를 확인하십시오: 묶음 안의 진술들이 바람직성 수준에서 균형을 이루는지가 핵심입니다. 형식의 이름보다 문항 구성이 왜곡 저항성을 결정합니다.
- 성격검사를 단독 관문으로 쓰지 마십시오: 집단 수준의 타당도는 유지되더라도, 합격선 근처의 개인 판정은 왜곡의 영향을 크게 받습니다. 경쟁률이 높은 채용일수록 다른 도구와의 조합이 중요합니다.
- 검사 결과를 면접 질문의 재료로 쓰십시오: 높게 나온 특성을 행동 사례로 확인하는 구조화 질문을 붙이면, 꾸민 점수는 면접에서 자연스럽게 걸러집니다.
- 경고문은 사실만 쓰십시오: 탐지 가능성과 결과를 함께 알리는 경고가 효과적이지만, 실제로 운영하지 않는 검증 절차를 암시하는 것은 지원자 신뢰를 해칩니다.
- 선발용과 개발용 진단의 용도를 분리해 약속하십시오: 개발용 진단이 평가에 쓰인다는 인식이 생기면 그 데이터도 부풀려집니다. 결과 열람 범위와 활용 목적을 문서로 명시하고 지키십시오.
응답 왜곡은 성격검사의 결함이라기보다 사람이 평가받는 상황에서 보이는 자연스러운 반응입니다. 면접에서 가장 좋은 옷을 입고 오는 것과 크게 다르지 않습니다. 문제는 그것을 모른 척하고 점수를 액면 그대로 읽는 데 있습니다. 검사지 앞에서 사람이 더 성실해진다는 사실을 인정하고 나면, 해야 할 일은 분명해집니다. 꾸미기 어려운 형식을 고르고, 다른 도구로 교차 확인하고, 점수가 가장 정직하게 나오는 상황에서 사람을 다시 들여다보는 것입니다.
참고 자료
- Birkeland, S. A., Manson, T. M., Kisamore, J. L., Brannick, M. T., & Smith, M. A. (2006), A Meta-Analytic Investigation of Job Applicant Faking on Personality Measures, International Journal of Selection and Assessment, 14, 317~335
- Griffith, R. L., Chmielowski, T., & Yoshita, Y. (2007), Do applicants fake? An examination of the frequency of applicant faking behavior, Personnel Review, 36, 341~355
- Hu, X., & Connelly, B. S. (2021), Faking by actual applicants on personality tests: A meta-analysis of within-subjects studies, International Journal of Selection and Assessment, 29, 412~426
- Ones, D. S., Viswesvaran, C., & Reiss, A. D. (1996), Role of social desirability in personality testing for personnel selection: The red herring, Journal of Applied Psychology, 81(6), 660~679
- Donovan, J. J., Dwight, S. A., & Schneider (2014), The Impact of Applicant Faking on Selection Measures, Hiring Decisions, and Employee Performance, Journal of Business and Psychology, 29, 479~493
- Cao, M., & Drasgow, F. (2019), Does Forcing Reduce Faking? A Meta-Analytic Review of Forced-Choice Personality Measures in High-Stakes Situations, Journal of Applied Psychology, 104(11), 1347~1368
- Martínez & Salgado (2021), A Meta-Analysis of the Faking Resistance of Forced-Choice Personality Inventories, Frontiers in Psychology
- Dwight, S. A., & Donovan, J. J. (2003), Do Warnings Not to Fake Reduce Faking?, Human Performance, 16(1)