평가자마다 점수가 다른 이유, 평가 캘리브레이션은 어떻게 해야 할까?

같은 수준의 성과를 냈는데 어떤 팀에서는 높은 평가를 받고, 다른 팀에서는 상대적으로 낮은 평가를 받는다면 구성원은 평가 결과를 쉽게 납득하기 어렵습니다.
성과평가를 운영하는 HR 담당자에게도 익숙한 문제입니다.
A 조직장은 높은 점수를 잘 주지 않고, B 조직장은 대부분의 구성원에게 높은 평가를 줍니다. 또 어떤 평가자는 목표 달성률을 중요하게 보고, 다른 평가자는 업무 과정이나 협업 기여도를 더 중요하게 볼 수도 있습니다.
평가기준이 존재한다고 해서 평가 결과가 자동으로 일관되어지는 것은 아닙니다.
그래서 필요한 과정이 평가 캘리브레이션(Evaluation Calibration)입니다.
평가 캘리브레이션의 목적은 억지로 평가점수를 똑같이 만드는 것이 아닙니다. 평가자가 서로 다른 기준으로 판단하고 있지는 않은지 확인하고, 평가 결과의 근거와 기준을 조직 차원에서 일관되게 맞추는 것이 핵심입니다.
평가자마다 점수가 달라지는 이유는 무엇일까?
평가자 간 점수 차이가 발생하는 가장 큰 이유는 평가가 결국 사람의 판단을 포함하기 때문입니다.
같은 평가기준을 제공하더라도 평가자가 이를 해석하는 방식은 달라질 수 있습니다.
대표적으로 다음과 같은 차이가 발생합니다.
어떤 평가자는 기대 수준을 충족하면 높은 점수를 주는 반면, 다른 평가자는 기대 수준을 크게 넘어야 높은 점수를 줄 수 있다고 생각할 수 있습니다.
‘목표 달성’, ‘업무 기여’, ‘협업’, ‘리더십’처럼 평가항목은 같아도 어느 수준을 A, B, C 등급으로 볼 것인지 평가자마다 판단 기준이 다를 수 있습니다.
평가기간 전체보다 평가 직전에 있었던 성공이나 실수가 결과에 지나치게 영향을 줄 수도 있습니다.
한 가지 뛰어난 성과 때문에 다른 항목까지 높게 평가하거나, 반대로 하나의 실수 때문에 전체 성과를 낮게 평가하는 현상도 발생할 수 있습니다. |
결국 평가자 편차를 줄이려면 평가표를 제공하는 것만으로는 부족합니다.
평가기준을 동일하게 이해하고 있는지 확인하는 과정이 필요합니다.

평가 캘리브레이션은 무엇을 하는 과정일까?
평가 캘리브레이션은 여러 평가자의 결과를 함께 검토하면서 비슷한 성과 수준에 동일한 평가기준이 적용되고 있는지 확인하는 과정입니다.
예를 들어 A팀과 B팀에서 비슷한 수준의 목표를 달성하고 유사한 역할을 수행한 구성원이 서로 크게 다른 평가를 받았다면 그 차이에 합리적인 이유가 있는지 검토할 수 있습니다.
중요한 것은 단순히 점수만 비교하지 않는 것입니다.
다음과 같은 내용을 함께 봐야 합니다.
|
점수 차이가 있다는 이유만으로 반드시 수정해야 하는 것은 아닙니다.
역할이나 목표 난이도, 실제 성과에 차이가 있다면 평가 결과도 다를 수 있습니다.
따라서 캘리브레이션에서는 “왜 이 점수가 나왔는가?”를 설명할 수 있는 근거가 있는지 확인하는 것이 중요합니다.
평가 캘리브레이션은 어떻게 진행해야 할까?
실무에서는 다음과 같은 순서로 진행할 수 있습니다.
1. 평가기준부터 다시 확인합니다
캘리브레이션 회의 전에 평가자가 같은 기준을 사용하고 있는지 확인해야 합니다.
예를 들어 A등급을 ‘목표를 달성한 경우’로 볼 것인지, ‘목표를 크게 초과한 경우’로 볼 것인지부터 명확해야 합니다.
평가항목별 정의와 등급별 기준이 모호하다면 회의 때마다 평가자의 의견 충돌이 반복될 수 있습니다.
2. 평가자별 점수 분포를 확인합니다
특정 평가자에게 높은 점수가 집중되거나 반대로 낮은 점수가 지나치게 많지는 않은지 확인합니다.
여기서 중요한 것은 일정한 점수 분포를 강제로 만드는 것이 아닙니다.
평가자마다 점수 사용 방식이 지나치게 다른 경우 기준 해석에 차이가 있는지 확인하기 위한 신호로 활용하는 것이 좋습니다.
3. 차이가 큰 평가 결과의 근거를 확인합니다
모든 직원을 한 명씩 다시 평가하면 캘리브레이션 회의가 지나치게 길어질 수 있습니다.
대신 평가자 간 판단 차이가 크거나 등급 경계에 있는 대상자, 특별히 확인이 필요한 사례를 중심으로 논의하는 방식이 효율적입니다.
이때 “누가 더 일을 잘했는가?”가 아니라 어떤 성과와 기준을 근거로 해당 등급을 부여했는가를 확인해야 합니다.
4. 유사한 역할과 성과를 비교합니다
비슷한 역할이나 책임 수준을 가진 구성원의 평가 결과를 함께 보면 평가자 편차를 확인하기 쉽습니다.
예를 들어 유사한 직무와 목표를 가진 직원에게 서로 다른 평가기준이 적용됐다면 그 차이가 적절한지 확인할 수 있습니다.
단, 단순히 직급이 같다는 이유만으로 성과를 동일하게 비교해서는 안 됩니다.
업무 목표와 역할, 책임 범위를 함께 봐야 합니다.
5. 조정 결과와 이유를 남깁니다
캘리브레이션을 통해 평가등급을 변경했다면 변경 결과뿐 아니라 이유도 관리하는 것이 중요합니다.
평가자가 처음 어떤 근거로 점수를 부여했고, 캘리브레이션 과정에서 어떤 기준으로 조정했는지가 남아야 다음 평가에서도 동일한 기준을 적용할 수 있습니다.
캘리브레이션이 매년 처음부터 다시 시작되는 회의가 되지 않으려면 평가 기준과 판단 근거가 축적되는 구조가 필요합니다.

캘리브레이션과 강제배분은 같은 개념이 아닙니다
평가 캘리브레이션을 평가등급 비율을 맞추는 과정으로 이해하는 경우도 있습니다.
하지만 두 개념은 구분해서 볼 필요가 있습니다.
강제배분은 조직에서 정한 평가등급별 비율이나 분포를 적용하는 운영 방식이고, 캘리브레이션은 평가 결과에 동일한 평가기준이 적용됐는지 검토하는 과정입니다.
따라서 좋은 캘리브레이션 회의의 질문은 다음과 같아야 합니다.
“현재 A등급이 너무 많지 않나요?”보다 “이 구성원에게 A등급을 부여한 근거가 우리가 정한 A등급 기준과 일치하는가?” 를 먼저 확인해야 합니다.
평가 캘리브레이션의 핵심은 점수의 모양을 맞추는 것이 아니라 평가 판단의 기준을 맞추는 것입니다.
평가 캘리브레이션에서 피해야 할 운영 방식
캘리브레이션을 잘못 운영하면 오히려 평가에 대한 불신이 커질 수 있습니다.
특히 다음 방식은 주의해야 합니다.
높은 평가가 많다는 이유만으로 근거 없이 등급을 낮추면 구성원이 평가 결과를 받아들이기 어렵습니다.
평가 근거보다 직급이나 발언권에 따라 결과가 바뀌면 캘리브레이션의 목적이 사라집니다.
최근 성과나 특정 사건보다 전체 평가기간의 목표와 결과를 기준으로 판단해야 합니다.
점수만 변경하고 이유를 관리하지 않으면 다음 평가에서 같은 논쟁이 반복됩니다. |
결국 좋은 캘리브레이션을 위해서는 회의 자체보다 평가 데이터와 판단 근거가 체계적으로 준비되어 있어야 합니다.
평가 시스템을 검토할 때 캘리브레이션 관점에서 확인할 것
성과평가 시스템을 검토한다면 단순히 평가자가 점수를 입력할 수 있는지만 확인해서는 부족합니다.
평가 운영 전체 흐름을 기준으로 살펴볼 필요가 있습니다.
예를 들어 다음과 같은 질문입니다.
|
성과평가 시스템의 역할은 평가표를 온라인으로 옮기는 데 그치지 않습니다.
목표 설정부터 평가, 조정, 최종 결과까지 하나의 평가 프로세스로 관리할 수 있는 환경을 만드는 것이 중요합니다.
평가 결과의 일관성을 높이려면, 유스트라 성과평가
평가자마다 서로 다른 기준을 적용하는 문제는 평가회의 한 번으로 해결하기 어렵습니다.
평가 이전에는 목표와 평가기준이 명확해야 하고, 평가 단계에서는 결과와 판단 근거가 함께 관리되어야 하며, 이후에는 여러 평가자의 결과를 비교하고 조정할 수 있는 운영체계가 필요합니다.
이처럼 평가 운영을 체계화하려면 평가서를 작성하고 점수를 입력하는 개별 작업보다 성과평가 전체 프로세스를 하나의 기준으로 관리하는 구조가 중요합니다.
유스트라 성과평가는 기업의 성과평가 업무를 시스템 중심으로 운영하려는 조직에서 활용할 수 있는 솔루션입니다.
평가 과정이 개인별 엑셀이나 개별 자료에 흩어져 있다면 평가기준과 결과를 비교하고 판단 근거를 확인하는 과정도 복잡해질 수 있습니다. 반대로 평가 업무를 시스템 중심으로 관리하면 평가 운영 과정에서 필요한 정보를 보다 일관된 기준으로 다룰 수 있고, 평가자별 판단 차이를 확인해야 하는 캘리브레이션 과정에서도 체계적인 평가 운영 기반을 마련할 수 있습니다.
결국 공정한 성과평가를 만드는 핵심은 모두에게 같은 점수를 주는 것이 아니라, 서로 다른 평가자가 같은 기준을 적용하도록 만드는 것입니다.
평가제도와 운영 프로세스를 체계적으로 관리하고 평가 결과의 일관성을 높이려는 기업이라면 유스트라 성과평가가 이를 위한 실질적인 해답이 될 수 있습니다.
FAQ Q1. 평가 캘리브레이션이란 무엇인가요? 여러 평가자의 평가 결과를 비교해 동일한 평가기준이 일관되게 적용됐는지 확인하는 과정입니다. 단순히 평가등급을 맞추는 것이 아니라 점수와 판단 근거를 함께 검토하는 것이 중요합니다. Q2. 평가자마다 점수가 다른 것은 무조건 문제인가요? 그렇지는 않습니다. 구성원의 목표, 역할, 성과가 다르다면 평가 결과도 달라질 수 있습니다. 문제는 유사한 성과에 서로 다른 평가기준이 적용되는 경우입니다. Q3. 캘리브레이션과 강제배분은 무엇이 다른가요? 강제배분은 정해진 등급 비율을 적용하는 운영 방식입니다. 반면 캘리브레이션은 평가 결과와 근거를 비교하여 평가기준이 일관되게 적용됐는지 확인하는 과정입니다. Q4. 평가자 편향을 줄이려면 가장 먼저 무엇을 해야 하나요? 평가항목과 등급별 기준을 구체적으로 정의하는 것이 우선입니다. 같은 A등급이라도 평가자마다 의미를 다르게 이해한다면 평가자 편차가 계속 발생할 수 있습니다. Q5. 캘리브레이션 회의에서 모든 직원을 다시 평가해야 하나요? 반드시 그럴 필요는 없습니다. 평가자별 점수 차이가 크거나 등급 경계에 있는 대상 등 확인이 필요한 사례를 중심으로 평가 근거를 검토하는 방식으로 운영할 수 있습니다. |
평가자마다 기준이 달라 매년 평가등급을 다시 조정하고 있다면 평가회의보다 먼저 평가 운영 구조를 점검해야 합니다. 목표와 평가기준, 평가 결과와 판단 근거가 하나의 프로세스로 연결되어야 평가자 편차를 체계적으로 관리할 수 있습니다. 성과평가 운영을 보다 체계적으로 관리하고 싶다면 유스트라 성과평가를 확인해보세요. 우리 조직에 필요한 성과평가 환경을 GS비즈플의 유스트라 성과평가와 함께 만들어보세요. |



댓글