“小李很有主人翁意识”“小周沟通能力需要提升”。这两句话读起来像评价,却没有说明发生了什么、造成什么影响,也无法让校准会议判断不同经理使用的是不是同一把尺子。
AI 可以帮助经理从项目、目标和反馈中找证据,但不应该根据语气猜测人格,更不能用看似专业的文字掩盖资料不足。
先从岗位期待和周期目标开始
准备岗位、级别、职责边界、评估周期和已确认目标。若员工在周期中调岗、休假或目标发生变化,应把时间段拆开说明。不能用当前岗位的要求评价他尚未承担的历史阶段,也不能在年底临时加入从未沟通过的标准。
列出完成的项目、指标、客户或内部反馈、事故处理、文档和协作记录。来源要能追溯到具体日期或交付物。仅依赖最近一个月容易产生近因偏差,仅依赖经理记忆也会漏掉不显眼但持续的重要工作。

把形容词改成情境、行为和影响
“沟通不好”可以拆成:在某次跨团队依赖延期后,没有在约定时间更新风险,导致测试团队晚两天调整计划;来源是项目状态记录和双方复盘。这样才能讨论期待是什么、影响有多大、后续如何改进。
正面评价也要同样具体。“推动力强”应指向他识别了什么阻塞、采取了什么动作、带来什么结果。影响不必总是百分比,也可以是减少返工、提前暴露风险、让决策更快或建立可复用机制。
让Skill组织材料,而不是替经理回忆
performance-review 提供自评、经理评价和校准三种模式,可把关键成果、目标、优势、发展领域、影响、发展计划和晋升讨论组织起来。连接 HRIS 或项目管理工具时可以补充岗位信息和工作记录;没有连接时也能处理用户提供的材料。
先让 AI 输出证据缺口,例如某条结论没有例子、某项目只有结果没有员工贡献、某项反馈无法确认时间。缺口未补齐时,降低表述确定性,不要让模型自动编一个“典型案例”。

评级必须对应同一层级的期待
校准前建立包含岗位、级别、目标、证据、建议评级和争议点的表格。校准时要回到各自的职责范围,判断员工是否持续达到或超过该级别期待,不能只看项目听起来有多大。跨团队影响、复杂度和独立性要用组织已有定义解释。
Skill 示例中出现的评级分布只能用来准备讨论,不能直接当作强制比例。为了凑分布而改变个人判断,会让证据服务于结果。校准会应优先处理边界案例、近期调岗、重大环境差异和晋升候选。
发展建议要让员工知道下一步
“提升战略思维”过于抽象。可以写成:下季度负责一次跨团队方案评审,在评审前提交包含目标、方案取舍和风险的两页材料,并由经理在会后反馈。动作、观察方式和时间都清楚,才可能真正发展。
评价行为,不评价人格。避免“情绪化”“不成熟”等标签,改写为可观察行为与工作影响。涉及健康、家庭、年龄等敏感信息时,应从材料中排除,遵守组织政策和适用规则。
交付前做一轮公平性检查
检查正面和改进意见是否都有证据,是否对不同员工使用了同样的详细程度,是否把团队或资源问题全归到个人,是否出现无法向员工当面解释的句子。再朗读整篇评语,删除空泛赞美、绝对化判断和含糊暗示。
一份可校准的绩效评语不需要写得漂亮,而要让员工、经理和校准小组都能看见同一条证据链:发生了什么、员工做了什么、产生什么影响、下一步怎么验证改进。AI 帮助整理这条链,责任仍在经理。

技能提升网