“평가센터 연구 25년이 지난 지금 분명해진 것은, 각 과제가 끝날 때마다 매기는 역량 점수가 그 점수에 붙은 역량이 아니라 그 점수를 매긴 과제의 효과를 상당 부분 반영한다는 사실이다.” 산업조직심리학자 찰스 랜스(Charles E. Lance)가 학술지 Industrial and Organizational Psychology 2008년 창간호에 실은 논문 「평가센터는 우리가 의도한 방식으로 작동하지 않는다」의 초록 첫머리입니다. 그가 이 문장으로 요약한 것은 평가센터 기법이 반세기 가까이 안고 온 이른바 구성타당도 문제입니다. 한국의 HR 담당자에게 이 문제는 남의 이야기가 아닙니다. 고위공무원단 역량평가, 과장급 승진 역량평가, 대기업의 리더 후보군 진단이 모두 같은 기법 위에 서 있기 때문입니다. 이 글은 그 문제가 무엇이고, 왜 예측력은 멀쩡한데 측정은 어긋나는지, 그리고 진단을 설계하고 운영하는 입장에서 무엇을 바꿔야 하는지를 정리한 것입니다.
여섯 개의 역량, 네 개의 과제, 평균 2.50점
먼저 우리가 실제로 무엇을 하고 있는지부터 확인해 보겠습니다. 인사혁신처가 안내하는 고위공무원단 후보자 역량평가는 2006년 7월 1일 고위공무원단 제도와 함께 시작됐습니다. 평가하는 역량은 문제인식, 전략적사고, 성과지향, 변화관리, 고객만족, 조정·통합의 여섯 가지입니다. 평가 방법은 네 가지로, 기자 인터뷰 형식의 1:1 역할수행, 정책 찬반 대립과 부처 간 이해관계 조정을 다루는 1:2 역할수행, 현안과제 해결방안을 마련하는 서류함기법, 그리고 사업 선정이나 예산 감축 같은 쟁점을 합의하는 집단토론입니다. 채점은 역량 항목별 5점 만점이고, 여섯 역량의 평균이 2.50점 이상이면 통과합니다.
구조를 그림으로 옮기면 여섯 행과 네 열로 이루어진 격자가 됩니다. 행은 역량이고 열은 과제입니다. 이 설계에 깔린 전제는 명확합니다. 전략적사고라는 역량이 한 사람 안에 일정한 수준으로 존재하고, 그 수준이 서류함기법에서도 집단토론에서도 비슷하게 드러난다는 것입니다. 그래야 네 칸을 평균 내어 ‘이 사람의 전략적사고는 3.2점’이라고 말할 수 있습니다. 격자를 가로로 읽어 하나의 숫자로 뭉치는 이 동작이 역량평가의 심장부입니다.
문제는 실증 자료가 이 격자를 가로가 아니라 세로로 읽으라고 말한다는 데 있습니다.
1982년, 요인분석이 뽑아낸 것은 역량이 아니었다
이 문제를 처음 정면으로 보고한 사람은 폴 새킷(Paul Sackett)과 조지 드레어(George Dreher)입니다. 두 사람이 1982년 Journal of Applied Psychology 67권에 발표한 논문의 제목 자체가 이미 결론을 담고 있습니다. 「구성개념과 평가센터 차원: 몇 가지 곤혹스러운 실증적 발견」입니다.
이들은 세 개 조직의 평가센터 자료를 놓고, 여러 역량을 여러 과제에서 매긴 점수들을 탐색적 요인분석에 넣었습니다. 만약 설계 의도대로 작동한다면 요인은 역량 단위로 묶여야 합니다. 서류함기법에서 매긴 전략적사고와 집단토론에서 매긴 전략적사고가 한 요인으로 모여야 하는 것이죠. 그런데 뽑혀 나온 요인은 역량이 아니라 과제였습니다. 서류함기법에서 매긴 여섯 개 역량 점수가 서로 뭉치고, 집단토론에서 매긴 여섯 개 점수가 따로 뭉쳤습니다.
측정 용어로 옮기면 두 가지가 동시에 무너진 것입니다. 같은 역량을 다른 과제에서 잰 점수들이 서로 잘 상관하지 않았으니 수렴타당도가 낮고, 다른 역량을 같은 과제에서 잰 점수들이 지나치게 높게 상관했으니 변별타당도도 낮습니다. 사람을 놓고 다시 말하면 이렇습니다. 서류함기법을 잘한 사람은 그 과제 안의 모든 역량에서 고르게 높은 점수를 받고, 집단토론에서 고전한 사람은 그 과제 안의 모든 역량에서 고르게 낮은 점수를 받습니다.
이 결과는 한 번의 우연이 아니었습니다. 이후 수십 편의 연구가 같은 패턴을 재현했고, 2020년 Frontiers in Psychology에 실린 방법론 리뷰는 그동안의 발견을 “과제 종료 시점 역량 점수의 분산 대부분은 차원 요인이 아니라 과제 요인을 가리킨다”고 요약합니다. 같은 리뷰가 인용한 시미노프스키 등(2015)의 재분석에서 차원이 설명한 분산은 수렴 모형 기준으로 전체의 22%에 못 미쳤습니다.
예측은 되는데 측정은 안 되는 역설
여기서 성급한 결론으로 건너뛰기 쉽습니다. 그러면 역량평가를 걷어내야 하느냐는 것이죠. 그렇지 않습니다. 같은 기간의 준거타당도 연구는 정반대 방향을 가리킵니다.
바버라 고글러(Barbara Gaugler)와 동료들이 1987년 Journal of Applied Psychology 72권에 발표한 메타분석은 50편의 연구에서 107개의 타당도 계수를 모아 교정 평균 .37을 얻었습니다. 채용과 승진 예측 도구로서 결코 낮은 값이 아닙니다. 역량 단위로 내려가 본 연구도 있습니다. 윈프레드 아서(Winfred Arthur)와 동료들이 2003년 Personnel Psychology에 실은 메타분석은 34편의 논문에 흩어져 있던 168개의 역량 명칭을 여섯 개로 정리한 뒤 258개의 독립 자료점을 뽑았습니다. 여섯 역량은 타인에 대한 배려와 인식, 의사소통, 추진력, 타인에 대한 영향력, 조직화와 계획, 문제해결이었고, 추정된 진짜 준거타당도는 .25에서 .39 사이에 분포했습니다. 더 흥미로운 것은 이 중 네 개 역량을 조합했을 때 성과 분산의 20%를 설명해, 종합 평정 하나만 썼을 때의 14%를 넘어섰다는 대목입니다.
정리하면 이렇습니다. 평가센터는 미래 성과를 꽤 잘 맞힙니다. 그런데 무엇을 재고 있느냐고 물으면, 우리가 결과지에 인쇄한 그 역량이라고 답하기가 어렵습니다. 예측은 되는데 측정은 안 되는 역설입니다. 진단 도구를 다루는 입장에서 이 구분은 사소하지 않습니다. 선발 의사결정의 근거로 쓰는 것과, 개인에게 “당신은 조정·통합이 약합니다”라고 피드백하고 그 항목을 겨냥한 육성 계획을 세우는 것은 요구하는 타당도의 종류가 다르기 때문입니다. 앞의 용도는 준거타당도로 충분하지만, 뒤의 용도는 구성타당도를 요구합니다. 랜스가 지적한 지점이 바로 여기입니다.
행동은 원래 상황마다 다르다
왜 이런 일이 벌어질까요. 오랫동안 이 현상은 평가위원의 실수로 취급됐습니다. 관찰이 서툴러서, 후광효과에 걸려서, 훈련이 부족해서 과제별로 점수가 뭉친다는 설명이었죠. 그래서 처방도 평가위원 쪽에 집중됐습니다. 관찰자 훈련을 늘리고, 행동 기록을 강제하고, 평가위원을 과제마다 교체하는 식입니다.
랜스는 25년치 연구를 검토한 뒤 이 전제를 뒤집습니다. 그의 결론은 세 가지였습니다. 첫째, 종래의 통념과 달리 평가 대상자의 행동은 본래 상황을 넘나들며 일관된 것이 아니라 상황 특수적입니다. 둘째, 평가위원은 오히려 행동을 상당히 정확하게 관찰하고 있습니다. 셋째, 이 사실을 인정해 평가센터를 전통적인 차원 기반에서 과제 기반 또는 역할 기반 설계로 다시 짜야 합니다.
“평가 대상자의 행동은 본질적으로 상황을 넘나들며 특수한 것이지, 한때 생각했던 것처럼 상황을 넘나들며 일관된 것이 아니다. 그리고 평가위원은 대상자의 행동을 상당히 정확하게 평가한다.”
Charles E. Lance (2008), 「Why Assessment Centers Do Not Work the Way They Are Supposed To」, Industrial and Organizational Psychology, 1권 1호, 84~97쪽
두 번째 결론이 특히 중요합니다. 평가위원이 정확하다면, 과제별로 점수가 갈리는 것은 잡음이 아니라 신호입니다. 같은 사람이 서류함기법에서는 침착하게 우선순위를 정리하고 집단토론에서는 밀려나는 일은 흔합니다. 그것은 측정 오류가 아니라 그 사람에 대한 진짜 정보입니다. 문제는 우리가 그 정보를 평균 내어 지워 버린다는 데 있습니다.
과제가 방아쇠를 당겨야 역량이 보인다
이 상황 특수성을 설명하는 틀이 특성활성화이론(trait activation theory)입니다. 필립 리븐스(Filip Lievens)와 동료들이 The Oxford Handbook of Personnel Psychology(2008) 9장에서 평가센터에 적용한 논의를 따라가 보겠습니다.
핵심 개념은 특성활성화 잠재력입니다. 어떤 상황이 특정 성향과 관련된 행동의 개인차를 드러나게 하는 정도를 뜻하며, 상황의 관련성과 상황의 강도라는 두 요소로 결정됩니다. 평가센터 과제는 저마다 이 잠재력이 다릅니다. 리븐스는 대인 영향력이라는 역량을 예로 듭니다. 이 역량은 외향성이라는 성향의 표현이므로, 리더 없는 집단토론과 역할수행은 둘 다 관련 단서를 제공하니 두 과제의 점수는 수렴할 것으로 기대할 수 있습니다. 그러나 계획 수립 과제는 그런 단서를 거의 제공하지 않으므로, 거기서 매긴 대인 영향력 점수가 다른 과제와 강하게 상관하리라 기대할 이유가 없습니다.
실증도 이 방향을 지지합니다. 하랜드(Haaland)와 크리스티안센(Christiansen)이 2002년 Personnel Psychology 55권에 발표한 연구는 법집행기관의 승진용 평가센터 자료(응시자 79명)를 사용했습니다. 이들은 먼저 주제 전문가들에게 각 과제에서 빅파이브 성향과 관련된 행동을 관찰할 수 있는지 판단하게 하고, 평가센터의 역량을 빅파이브 성향에 연결하게 했습니다. 그런 다음 특성활성화 잠재력이 높은 과제끼리의 상관과 낮은 과제끼리의 상관을 비교했습니다. 결과는 과제의 특성활성화 잠재력이 수렴타당도에서 중요한 역할을 한다는 함의를 지지했습니다. 리븐스 등(2006)이 다수의 평가센터를 대상으로 한 대규모 검증에서도 같은 방향의 지지가 나왔으나, 효과의 크기 자체는 작았다는 단서가 함께 붙습니다.
여기서 한 가지 더 짚을 것은 표면적 행동과 심층 성향의 구분입니다. 하랜드와 크리스티안센이 든 예가 좋습니다. 상황을 해결하기 위해 위험을 감수해야 하는 과제와, 자기 입장을 받아들이도록 사람들을 설득해야 하는 과제는 겉보기 행동이 전혀 다릅니다. 그러나 둘 다 외향성의 구성개념 영역에 들어가므로, 이 성향에 연결된 역량이라면 두 과제 사이에 수렴을 기대할 수 있습니다. 과제를 비슷하게 만들라는 뜻이 아니라, 같은 성향을 건드리도록 설계하라는 뜻입니다.
실무에서 무엇을 바꿀 것인가
이론을 실행으로 옮기면 네 가지 조치로 정리됩니다. 리븐스와 동료들이 제시한 처방을 한국 조직의 운영 현실에 맞춰 옮겨 보겠습니다.
첫째, 과제에 관련 단서를 의도적으로 심습니다. 스트레스 내성처럼 정서적 안정성과 연결된 역량을 보고 싶다면, 그 성향과 관련된 행동을 촉발하는 상황을 써야 합니다. 리븐스가 든 예는 까다로운 질문이 따라붙는 구두 발표입니다. 촉박한 시간 제한, 돌발 장애물, 정보 과부하를 과제에 넣는 것도 같은 계열의 장치입니다. 아울러 과제 설명에 직무 요구, 사회적 요구, 조직 차원의 요구라는 세 층위의 단서가 모두 담기도록 합니다. 평가센터 과제가 다른 도구보다 나은 지점이 바로 여기입니다. 고객이나 동료, 상사와 함께 일하는 장면을 상대역으로 구현할 수 있고, 특정 조직 문화 안에 그 장면을 앉힐 수 있습니다.
둘째, 과제를 지나치게 강한 상황으로 만들지 않습니다. 이 조언은 직관에 반해서 자주 무시됩니다. 과제 지시가 너무 명확하고 상대역이 무엇을 말할지까지 규정되어 있으면, 응시자에게 남는 선택지가 거의 없습니다. 예컨대 역할수행 지시가 “해당 직원을 해고하라”라고 못 박아 버리면, 해고 여부라는 판단 자체가 사라집니다. 이런 강한 상황은 역량 표현의 변산을 줄여 버립니다. 그래서 잘 만든 과제에는 의도된 모호함이 일정하게 남아 있습니다. 응시자가 상황을 어떻게 다루는지에서 차이가 드러나야 하기 때문입니다. 다만 균형이 필요합니다. 모호함이 과도하면 채점의 일관성이 흔들리므로, 열어 두는 것은 선택지이지 채점 기준이 아닙니다.
셋째, 역량 목록을 정리하고 구체화합니다. 역량은 보통 직무분석에서 나오지만, 일단 목록이 나온 뒤에는 특성활성화의 관점에서 한 번 더 손질할 여지가 있습니다. 같은 성향의 표현으로 보이는 역량은 한 과제 안에서 통합하거나 덜어냅니다. 리븐스가 든 예는 ‘혁신’과 ‘적응력’입니다. 둘 다 개방성의 표현일 수 있습니다. 아울러 포괄적 개념보다 구체적 역량을 쓰는 편이 낫습니다. 한 과제에서 여섯 개, 여덟 개의 역량을 동시에 매기게 하는 설계는 변별을 요구하는 것이 아니라 사실상 불가능한 일을 요구하는 것입니다.
넷째, 과제 유형을 다양하게 가져갑니다. 고글러 등(1987)의 메타분석은 조절변수도 함께 보고했는데, 서로 다른 유형의 과제를 더 많이 쓴 평가센터일수록, 동료 평가를 포함한 경우일수록, 평가위원이 심리학자와 관리자로 함께 구성된 경우일수록 타당도가 높았습니다. 행동이 상황 특수적이라면 표본을 여러 상황에서 뽑아야 한다는 이야기이므로, 이 결과는 앞선 논의와 정확히 맞물립니다. 비슷비슷한 과제 네 개보다 성격이 다른 과제 네 개가 낫습니다.
결과지를 다시 쓰는 문제
마지막으로 피드백입니다. 리븐스는 특성활성화이론의 실무 함의를 정리하면서, 피드백 보고서를 특정 역량이나 성향을 활성화한 상황을 중심으로 구성할 것을 제안합니다. 이것이 현재 관행과 가장 크게 갈리는 지점입니다.
지금의 결과지는 대개 역량별 막대그래프입니다. 조정·통합 3.1점, 성과지향 2.8점 같은 식이죠. 앞의 논의를 받아들인다면 이 표현은 근거가 약합니다. 네 과제의 점수를 평균 낸 숫자는, 정작 그 숫자를 만든 가장 큰 요인인 과제 차이를 지워 버린 값이기 때문입니다. 대안은 어렵지 않습니다. “대면 갈등 상황에서는 조정 행동이 잘 나왔지만, 문서로 다수의 이해관계를 조율해야 하는 상황에서는 우선순위가 흔들렸습니다”처럼 상황과 함께 기술하는 것입니다. 받는 사람에게도 이 편이 훨씬 실행 가능합니다. ‘조정·통합 역량을 기르라’는 주문은 무엇을 해야 할지 알려 주지 않지만, ‘문서 기반 다자 조율 상황을 반복 경험하라’는 주문은 다음 주에 할 일을 지정합니다.
덧붙여 운영상의 원칙 하나가 따라 나옵니다. 통과와 탈락을 가르는 선발용 총점과, 개인에게 돌려주는 육성용 피드백은 서로 다른 근거 위에 서 있으므로 문서를 분리하는 편이 안전합니다. 총점은 준거타당도에 기대어 정당화되고, 피드백은 관찰된 행동과 상황에 기대어 정당화됩니다. 둘을 한 장에 섞어 놓으면, 상대적으로 약한 근거를 가진 역량별 점수가 총점의 권위를 빌려 과잉 해석되기 쉽습니다.
HR 담당자를 위한 시사점
- 격자를 세로로도 읽으십시오: 역량별 평균만 보지 말고, 같은 사람의 점수가 과제에 따라 어떻게 갈렸는지를 함께 봅니다. 그 편차는 잡음이 아니라 어떤 상황에서 이 사람이 힘을 내는지에 대한 정보입니다.
- 선발 근거와 육성 근거를 분리하십시오: 총점으로 통과를 판정하는 것과 역량별 점수로 개인의 약점을 지목하는 것은 요구하는 타당도의 종류가 다릅니다. 문서도 분리하는 편이 안전합니다.
- 한 과제에서 재는 역량 수를 줄이십시오: 한 장면에서 여섯 개, 여덟 개를 동시에 변별하라는 요구는 평가위원의 역량 문제가 아니라 설계의 문제입니다. 과제마다 초점 역량을 두세 개로 좁힙니다.
- 과제 설계에 단서를 명시적으로 넣으십시오: 시간 제한, 돌발 정보, 저항하는 상대역처럼 보고 싶은 역량을 촉발할 장치를 의도적으로 배치합니다. 단서가 없으면 그 역량은 애초에 관찰되지 않습니다.
- 지시문을 너무 촘촘하게 쓰지 마십시오: 무엇을 해야 하는지까지 지정된 과제는 개인차를 지웁니다. 열어 두어야 하는 것은 선택지이고, 촘촘해야 하는 것은 채점 기준입니다.
- 비슷한 과제를 늘리지 말고 다른 과제를 늘리십시오: 과제 유형의 다양성은 메타분석에서 확인된 타당도 조절변수입니다. 행동이 상황 특수적일수록 여러 상황에서 표본을 뽑아야 합니다.
- 피드백을 상황 단위로 쓰십시오: 역량 이름과 점수 대신 어떤 장면에서 무엇이 관찰됐는지를 적습니다. 받는 사람이 다음에 무엇을 해 볼지 정할 수 있는 수준까지 구체화합니다.
참고 자료
- Charles E. Lance, 「Why Assessment Centers Do Not Work the Way They Are Supposed To」, Industrial and Organizational Psychology 1(1), 2008, 84~97쪽
- Paul R. Sackett & George F. Dreher, 「Constructs and Assessment Center Dimensions: Some Troubling Empirical Findings」, Journal of Applied Psychology 67(4), 1982, 401~410쪽
- Barbara B. Gaugler, Douglas B. Rosenthal, George C. Thornton III & Cynthia Bentson, 「Meta-Analysis of Assessment Center Validity」, Journal of Applied Psychology 72, 1987, 493~511쪽
- Winfred Arthur Jr., Eric A. Day, Theresa L. McNelly & Pamela S. Edens, 「A Meta-Analysis of the Criterion-Related Validity of Assessment Center Dimensions」, Personnel Psychology 56권, 2003
- Stephen Haaland & Neil D. Christiansen, 「Implications of Trait-Activation Theory for Evaluating the Construct Validity of Assessment Center Ratings」, Personnel Psychology 55권, 2002, 137~163쪽
- Filip Lievens, Lien De Koster & Eveline Schollaert, 「Current Theory and Practice of Assessment Centers: The Importance of Trait Activation」, The Oxford Handbook of Personnel Psychology 9장, 2008 (PDF)
- How Different Indicator-Dimension Ratios in Assessment Center Ratings Affect Evidence for Dimension Factors, Frontiers in Psychology 11, 2020
- 인사혁신처, 역량평가제도 「고위공무원단 후보자」 안내