Offers HR Magazine
イベントレポート

【イベントレポート】Ubieが実践するAI時代の人事評価 〜評価をAIに委ねたとき、人の役割はループのどこに残るのか〜

【イベントレポート】Ubieが実践するAI時代の人事評価 〜評価をAIに委ねたとき、人の役割はループのどこに残るのか〜
鈴木 裕斗監修者

株式会社overflow / 代表取締役 CEO

鈴木 裕斗

株式会社サイバーエージェントに新卒入社。広告営業を経て、Amebaプラットフォームの管轄責任者に就任。その後、スタートアップ企業に入社、代表取締役就任を経て2ヶ月後に株式会社ディー・エヌ・エーにM&A、子会社化。子会社代表取締役とDeNA広告部長を兼任。2017年6月、株式会社overflowを創業。2018年から2020年9月末までエキサイト株式会社の社外取締役を兼任。

橋山 牧人監修者

Ubie株式会社 / エンジニアリングマネージャー/HRBP/生成AI推進担当

橋山 牧人

新卒で楽天に入社。楽天市場の開発部でWebエンジニア、テックリードを経てエンジニアリングマネージャー(EM)へ。楽天スーパーSALEの負荷対策や、30人規模の多国籍チームのマネジメントを担当。2019年にOLTAへEMとして入社し、VPoEとして開発チーム全体のマネジメントや、採用・評価・組織開発を担当。2024年にUbieへ入社し、EM/HRBP/バックオフィスのマネージャーを兼務。人材開発の仕組みづくり、社内の生成AI推進、AI評価エージェントの開発などを担当している。

人事評価をAIに委ねたとき、人の役割はどこに残るのでしょうか。評価のための作文、マネージャー同士のキャリブレーション、報酬への反映。評価にまつわる運用の多くをAIに任せられる時代が、すぐそこまで来ています。

一方で「AIの評価は信用できるのか」「従業員は監視されていると感じないか」という懸念も根強く残ります。AIに評価を任せる会社は、この問いにどう答えているのでしょうか。

本記事は、2026年9月17日に開催したウェビナー「Ubieが実践するAI時代の人事評価 〜評価をAIに委ねたとき、人の役割はループのどこに残るのか〜」のレポートです。

登壇したのは、Ubie株式会社 アクセラレーター本部 EM / HRBP / 生成AI推進室の橋山牧人様。同社が昨年から運用する、生成AIによる人事評価の仕組みを解説しました。進行は株式会社overflow 代表取締役 CEOの鈴木裕斗が務めました。

「なぜAIで評価するのか」「どう実現しているのか」「どんな学びがあったのか」という3部構成の講演と、視聴者からの質疑応答を収録しています。

なぜAIで人事評価を行うのか。4つの目的

ホラクラシー・中間管理職を置かない・評価を報酬に紐づけていない、というUbieの組織の3つの特徴を示したスライド

前提:ホラクラシーの組織で、評価を報酬に紐づけていなかった

橋山様:Ubieはホラクラシーという組織形態をとっています。意思決定を人ではなく役割に紐づけ、そのロールが権限と責任を持つ構造です。マネジメントというロールを持つメンバーはいますが、中間管理職のように意思決定権を一人に集中させる形は取っていません。

また、これまで目標設定やフィードバックのサイクルは回していましたが、評価を報酬に紐づけていませんでした。事業の成長に応じて成果を適切に配分する必要が出てきたため、評価制度を作り直すことを決めました。その運用に生成AIをフルで活用することも、あわせて意思決定しています。

人がコトに集中し、評価の過程からバイアスを外す

評価のための作文をさせない・評価のレビューや調整に人の時間を使わない・人間は空いた時間を会社の成長に使う、という目的①を示したスライド

橋山様:なぜAIで人事評価を行うのか。我々には大きく4つの目的があります。1つ目は、人がコトに集中できるようにすることです。評価のために自分がやったことを思い出してアピールしたり、作文をしたりすることに時間を使っているケースは多いのではないでしょうか。

評価は事業を伸ばすための仕組みであり、その運用自体に時間を使いすぎるのは本末転倒です。評価のレビューや調整にも、マネジメントの工数を大きく使っている現実があります。人間の空いた時間はできるだけ会社の成長に使い、それ以外の業務をAIでやりたいと考えました。

2つ目は、評価の過程からバイアスを外すことです。AIで評価すると精度はどうなのか、という懸念が出てくるでしょう。しかし我々は、そもそも人間ですら精度高く評価できていない、という論に立っています。人間の評価は属人的で、評価者の記憶や暗黙知に頼るものです。

伝達は1on1というクローズドな場で行われ、マネージャー同士のキャリブレーションも限られたメンバーの中で行われます。評価がどう決まったかは公開されず、上司の評価能力や視野で結果が左右されます。

同じ物差しで全員を評価し、ファクトを網羅的に集め、ロジックを明瞭にして結果を検証・改善できる。このプロセスを回せることが、2つ目の目的です。

AI時代の働き方に合わせ、すべての活動がデータ化される力学をつくる

記録されていない活動は評価されないとして、日々の仕事がそのまま記録になる仕組みをつくるという目的④を示したスライド

橋山様:3つ目は、AI時代の働き方に合わせることです。PdM・エンジニア・デザイナーの垣根は、すごい速さで溶けています。私自身もバックオフィスのマネージャーを兼務していますが、労務や採用といった専門家の集団がやっていたことを、生成AIの力を借りて一人が見られる領域が広がっています。

評価者は、自分の専門性に関連する評価だけをしていればよかったものが、より広い領域を評価しなければならなくなりました。一人の評価者が複数の専門的なロールを評価するのは非常に難しいため、AIでサポートする必要があります。

4つ目は、すべての活動がデータ化される力学をつくることです。AIが評価するということは、評価に必要なデータがすべてデジタル化されているということです。記録が残っていないと、そもそも評価の対象になりません。

すべての活動がデータ化されないと評価されない、という力学が働くことになります。ここで蓄積した活動データは評価以外にも大きく活用できることが、我々の知見として分かってきました。

決めるのは代表だけ。本人から代表まで、間に誰も入れない

活動データが貯まる・AIがドラフトを作る・本人が補う・AIが検証し直す・代表が決める、という評価確定までの5ステップを示したスライド

橋山様:設計思想は3つあります。人事評価に関する決定権を代表のみに持たせること、等級(グレード)を会社が求める成果の期待値の総和と考えること、そしてAIを使うからには24時間365日、自分が求めるタイミングで常時フィードバックが得られることです。

まず、代表のみが決定権を持つという点です。人々が何かをしたときに、活動ログが記録として貯まる仕組みを作っています。この記録から、AIが特定期間の評価のドラフトを作ります。

ドラフトに対して本人が足りない部分を補足するプロセスを設け、それをAIが検証する、というステップです。仮で確定したものを、最後に代表が承認する形です。

このフローのポイントは、マネージャーや他の役員、人事も含めて、通常なら評価に関わるメンバーが一切入っていません。本人と代表、プラスAIだけで評価全体が動くプロセスにしています。

これによって、人間同士の調整やマネージャーへのアピール、マネージャー同士のキャリブレーションといった政治的な力学が一切働かない設計になっています。

成果と能力を別々に測り、掛け合わせる

収益側・損失側・生産能力という成果の出し方と、行動指針Ubienessとコアスキルによる能力の見立て方を並べ、成果グレードと能力グレードを掛け合わせて総合グレードとするスライド

橋山様:2つ目の設計思想は、グレードを成果の期待値の総和と考えることです。グレードの決め方として、成果と能力の2つを見立てることが重要です。事業を成長させることが成果として出るので、基本的に測りたいのは成果になります。

ただし、再現性高く成果を出せることは、能力として起算するものだと捉えています。成果は、やったことをそのまま定量化すると、定量化しやすい仕事とそうでない仕事が出てくるものです。そこで枠組みを作りました。

縦軸に収益側と損失側を置き、売上を直接生み出す仕事や、商談を前に進めて期待値を上げる仕事を成果と捉えます。効率化によるコスト削減や、品質を上げて将来発生し得る損失を防ぐことも、成果の型として定義しました。

すべての業務に関わる人が、何らかの成果を定量的に生み出せる考え方です。プロダクト組織であれば、仕組みを作って生産性を上げるという測り方もあります。

能力については、一人一人に求める行動指針であるUbienessと、それを支える専門性を含めたコアスキルのマップを用意しました。こちらで能力を測る形で、全体の評価制度を設計しています。

サイクルを回すほど、成果が上がる確度が高まる

活動が自動で記録され、AIがフィードバックを返し、本人が次の一手を決めて動き方を変えるサイクルを日次・週次で回すことを示したスライド

橋山様:3つ目は、常時フィードバックのサイクルを回せるようにすることです。活動が自動で記録されてAIが判断するので、人間と違って評価のタイミングや頻度に限界がありません。極端な話、毎日AIと壁打ちをして評価を受けることも可能です。

重要なのは、フィードバックをもらって本人が行動を修正すると、その結果がまた記録として残り、評価が回ることです。昨日やった活動が成果の上がる行動だったかどうかを、すぐに試せます。

人間中心の評価では早くても1週間、遅いと3か月や半期だったフィードバックサイクルを、極端な話、毎日回せる。これがこの設計思想の肝です。成果が上がる確度が会社全体として高まり、能力開発も自走的に行われるようになります。

活動ログからAIがドラフトし、伴走AIが日々のフィードバックを返す

SlackやGitHub、JIRA、Notion、議事録などの活動ログを集約してActivity Reportを生成し、評価AIエージェントと伴走AIエージェントが参照する全体像を示したスライド

橋山様:実装の話に入る前に、今作っているものをデモでご紹介します。まずアクティビティレポートです。Slackや議事録、GitHub、Notionといった会社の業務データを、BigQueryというGoogleのデータベースに集約しています。

そこから毎日の活動が、アクティビティレポートとして出てきます。いわゆる日報のようなもので、Google Meetで何をしていたか、JIRAやSlackでどんな活動をしていたかが、タイムライン上のサマリーで出てくる仕組みです。

「このエンジニアは直近どんなことをしていたか」とAIに聞けば、実装タスクの内容やチケット数を簡単に確認できます。チーム単位やプロジェクト単位での計測も可能です。

この一つ一つの活動記録が、生成AIによる評価のベースラインになります。活動記録に対しては、評価AIのエージェントが別に存在しています。対象期間の活動と、それによって生まれた成果をサマリーとして記録し、ドラフトを作るのがこのエージェントです。

我々はこれをファクトシートと呼んでおり、全員分を生成します。どの情報を参照したか、データソースもすべて付いています。

ここから作るのが、評価レポートのドラフトです。社内の基準に照らして「成果で言うと等級4相当、能力で言うと等級3相当で、結果として等級4相当ではないか」というドラフトが出てきます。なぜこの等級になったのか、一つ上の等級でない理由、一つ下の等級でない理由もAIがドラフティングします。

もう一つが、伴走するAIエージェントです。直近1か月に何をしたかをオープンクエスチョンで聞くと、アクティビティレポートを参照して、働き方の傾向や課題を評価基準や役割に応じてフィードバックしてくれます。

「どう成長できるか」「改善できるポイントはどこか」と聞けば、そこに向かう道筋を示してくれるエージェントです。納得できるものについては、本人が行動を変えていけます。

活動の記録や壁打ちの記録はすべてシステムに残るので、どういった人にどんな伸びしろがあるかを、後から人事側で分析することも容易です。会社全体の伸びしろがどこにあるかを踏まえて、制度全体をどうしていくかも考えられます。

AIがAIをレビューする。ヒューマン・オン・ザ・ループの実装

正確性が求められる処理はワークフロープログラム、推測・解釈・要約が求められる処理は生成AIに分け、前処理・加工から要約・解釈、最終集約へ流すデータ処理の工夫を示したスライド

正確性が求められる処理はプログラム、推測や要約は生成AI

橋山様:この評価チームは現時点では私を含めて3人で回しており、全員がエンジニアかデータ分析のバックグラウンドを持っています。そのため、実際にシステムを作り、ログの加工を行うことも可能です。

すべての情報を単純に生成AIに流し込むと、ノイズもデータ量も大きいのが実情です。そこで、正確性が求められる処理はプログラムで行い、コンテキストが正しく処理されたミニマムな情報だけを生成AIに渡すように分けています。これによって、より精度が高い状態で情報が日報として出てきます。

3つの採点表(ルーブリック)で、AIが自分で採点する

一次記録から、活動は十分に集まっているか・活動を正確に捉えられているか・成果と能力が見立てられているか、という3つの採点表を経て最終評価に至る流れを示したスライド

橋山様:2つ目は評価の精度です。精度を上げることには我々も苦戦していますが、ルーブリックと呼ばれる採点表を用いて、AI自体が何が正しいかを判断できるようにしています。一次記録から評価につなげるまでに、3つの採点ポイントを設けました。

1つ目は、評価可能な情報が十分に集まっているか。セールスなら商談の情報、エンジニアならコードの情報、オペレーショナルな職種ならさばいたチケットや問い合わせ対応のログが残っていなければなりません。

2つ目は、複数人で一つのプロジェクトをやったときに、貢献度や寄与率が正しく判定されているか。会議で発言量の多い人だけが評価されていないか、意思決定の起点を作った人が正しく評価されているかを見ます。3つ目は、成果と能力が正しく見立てられ、ロジックが適切かです。

AIがAIをレビューし、人は採点表を直す

AIが評価を作り、自分で採点し、基準に達しない限り差し戻して直すループを回し、人は結果を見て採点表を改善するというヒューマン・オン・ザ・ループの図解スライド

橋山様:この採点表を、AIでどう回しているのか。従来の生成AIと人間の関わり方は、ヒューマン・イン・ザ・ループ、つまり人間がループの中に入って対話しながら進めるやり方が一般的でした。しかしそれでは、人間がすべての意思決定をしなければならず、ボトルネックになります。

そこでヒューマン・オン・ザ・ループ、つまりループの上から人間がモニタリングする形にしています。AIにとって何が最適かをルーブリックとして定義して覚えさせ、AIが自分で採点できるようにするのです。

評価のドラフトを作ったらAIが自分でルーブリックを見に行って採点し、基準に達していなければ差し戻してまた作らせる。AIがAIをレビューするループを、基準を超えるまで回し続けます。

実際、現時点では、ファクトの状態から評価を作るまで、AIは一人当たり平均8時間から12時間ほど回り続けています。最終的に出てきたものを人間が見て精度に問題があれば、それはルーブリック、採点表の基準がおかしいということです。人は採点表に手を加えることで、評価の精度を高める。これが我々のアプローチです。

評価ロジックの開発にも、ソフトウェア開発のやり方を適用しています。ワークフローシステムやGitHubのようにバージョン履歴が残る仕組みを入れ、複数人で同時に編集でき、誰がいつ何を変更したかが分かるようにしました。

テストも充実させています。精度の変化がロジックの変更によるものか、モデル自体のアップデートによるものかを切り分けられる仕組みです。ロジックをいじっていたら評価が変わってしまった、ということが起きづらいようにしています。

会社が決めたものにはしない。仮運用・ロジック公開・全社員を巻き込む

仮運用の期間を置く・ロジックを隠さない・全社員を巻き込む、という導入の進め方3点を示したスライド

橋山様:評価というものは非常に政治的になりやすく、会社が決めたもの、受け入れるものになりやすいものです。その分、抵抗感が出やすいものです。それを防ぐために、AI評価の仕組みを入れるときにいくつかの工夫をしました。

1つ目は、仮運用の期間を置くことです。最終的には代表のみが決めるステップですが、そこに至るまではAIの精度が高くない前提で、人間が正解データを与える意味でキャリブレーションや修正を挟みます。

挟んだ内容も、すべて公開しながら進めるのが基本です。全社員がAIを使った評価プロセスに慣れる時間を、十分に取っています。

2つ目は、ロジックを隠さないことです。採点表そのものを社内ではすべてオープンに公開し、誰でもフィードバックできるようにしています。自分の評価がどう決まったのか分からなければ、ロジックを見に行き、生成AIに解説させて納得するまで壁打ちできます。

明らかな欠陥があれば、評価チームにフィードバックを送れる仕組みも担保しました。

3つ目は、全社員を巻き込むことです。トライアルチームをいくつか決め、本人たちが同意した下で、その評価を全体に公開しています。この人の等級は今のロジックだとこう評価される、というのをみんなで見ながら「これはおかしいのではないか」とオープンに議論できる仕組みです。

評価はみんなで作るプロダクトであり、会社から押し付けられたものではない。そういう状態になるように工夫しました。

AI時代に人に残るものを、先に定め直した

大きな成果を上げている人により多くの報酬を分配したい・成果は定量で測り期待値まで含めて評価する・能力も評価する、という評価制度の3つのコンセプトを示したスライド

評価制度の目的を、哲学まで含めて明瞭にする

橋山様:学びは大きく3つです。1つ目は、評価制度の目的を哲学まで含めて明瞭にすることです。AIが何をもってロジックを作り、どういう判断基準で評価するのか。分からなくなったときに立ち返るものがあるかどうかは、結構大きいと感じています。

我々は、大きな成果を上げている人により多くの報酬を分配したい、成果は定量で測るが期待値も含めて評価したい、成果を再現性高く出すには能力が必要なので能力も評価したい、という3つをコンセプトとしてまとめました。

その後のロジックや、AIに渡すルーブリックを作るときにも、基本的にここに立ち返ることができました。評価制度の目的を、人間にもAIにも分かる形で明瞭にすることが、AI評価を進める上で一番大きなポイントです。

人に残るのは「人とつながること」と「意思を込めること」

AI時代に人に残るものとして「人とのつながり」と「意思を込める」の2つを定め、人間の強みを信頼・感情・創造的な意思としたスライド

橋山様:2つ目は、AI評価を導入したら評価をしていたマネジメントには何が残るのか、という問いに回答を用意しておく必要があるということです。会社全体で、AI時代に人間に残るものは何かを定め直しました。結論として残るのは、人とつながることと、意思を込めることの2つだと考えています。

人とつながることとは、AIでは出てこない一次情報やクローズドな情報を、人間の信頼関係から引き出すことです。これは社外・社内を問いません。

意思を込めることとは、最終的に責任を持って何をやるかを決め、旗を立ててオーナーシップを持ってやりきることです。AIは整理や情報提供が得意ですが、ここは人間に必要な部分です。人間の強みである信頼や感情、創造的な意思は、評価においても残ると定義しました。

職種の壁が溶ける中で、どういう役割や人材要件が残るのかも整理しました。前線で課題を解決する「踊り手」と、それを支える「舞台装置」に大きく分け、人とのつながりを起点に持つ人、意思を込めることを起点に持つ人という形で、全部で5つの型に収れんするだろうと見ています。

エンジニアやPdM、労務、セールスというくくりではなく、このくくりで役割を見直しました。詳しくは、私が別途書いているnoteをご参照ください。

活動の記録が、評価以外の用途に活かされている

経営者には事業の状態が見え、マネージャーにはメンバーの状況が分かり、メンバーは自分で情報を取りに行ける、という活動記録の評価以外の活用を示したスライド

橋山様:3つ目は、AI評価のために作った活動の記録が、かなり多用途に生かせていることです。経営者からは、事業の状態が見えるダッシュボードが簡単に作れるようになったという声を聞いています。マネージャーはメンバーの状況が分かり、1on1のテーマや担当プロジェクトの状況が一目で分かる状態です。

メンバーにとっても、新しい部署やプロジェクトにアサインされたときに、何が重要で進捗はどうなっているかをAIに聞きながら把握できます。自分で情報を取りに行くコストが、大きく下がりました。

会社で起きていることの多くは記録されず、記録されていなければ評価も改善もできません。評価を起点として活動が記録される力学を、仕組みとして埋め込む。これが我々の目指していることであり、今回メリットとしても出てきています。

マネジメントにおいて、評価の仕事はどこが残るのか

マネジメントにおいて評価の仕事はどこが残るのかを、残るもの(評価を受け止めた人の感情への向き合い)と変わる必要があること(より広い領域での意思決定)に分けて示したスライド

橋山様:最後に、皆様への問いとして私の仮説をお話しします。マネジメントにおいて、評価の仕事はどこが残るのか。評価自体は、AIと本人を中心に行われるようになるかもしれません。

しかし、評価を受け止めた人が、その後どう成長し、成果を出していくのかという感情への向き合いは、人間が一緒に寄り添って方向性を決めたり、問いを投げたりする必要があります。この向き合いは、マネジメントに残ると考えています。

逆に、定型的な情報収集や調整業務、機械的に評価を下すことはなくなっていくでしょう。自分の専門領域だけに閉じているマネージャーの価値は、だんだん薄くなっていくはずです。

より大きな範囲で意思決定し、今まで見たことのない働き方をする人たちをいかに評価し、向き合い続けられるか。それが今のマネージャーに求められている、評価における変革点ではないでしょうか。

質疑応答

視聴者からの質問に回答するUbie株式会社 橋山牧人氏

評価ロジックは、成果とUbieのバリューのどちらに照らしているのか

――鈴木:ロジックの透明性で、どうして自分がこう評価されているのかが開示されているというお話がありました。そのロジックは、成果やUbieのバリューから設計されたロジック表のようなものに照らし合わせている、という理解でよいでしょうか。

橋山様:はい、その通りです。セールスで言うと分かりやすく、この期間にどの案件からどういった売上を上げたのかを金額換算しています。それ以外の仕事も、例えばプロダクトの機能を改善してリリースしたことは、セールスが売るための武器を作った、つまり売上の期待値を上げたことに合致します。

我々独自の評価ロジック、計算式を作り、そこに当てて換算しているイメージです。

最終承認を代表に寄せる設計は、組織が拡大しても運用できるのか

――鈴木:最終承認を代表に寄せるという設計は、組織が拡大しても変わらず運用できますか。どのくらいの組織規模までこの設計で運用できると思いますか。

橋山様:我々も実際の運用の中で、確かにこの課題はあると思っています。代表がすべてを見るというよりは、前の期に比べて等級が上がったり下がったりした、変化が起きたところや論点がありそうなところを中心に見ていきます。

全社員のうち、代表がしっかり見ないといけないのは最終的に10%以下ではないか、というのが現時点での我々の見立てです。もちろん1000人、2000人になれば、10%でも200人を見ることになります。

評価の精度を上げることや、代表の考えをインストールしたエージェントと事前に壁打ちできるようにすることも考えています。ただ、人間がまったく見ない形で評価を確定することは、今は考えていません。代表の負担を減らしつつ、適切に判断していただく効率をいかに上げるかが肝です。

――鈴木:評価に限らず、コーディングエージェントなどを使っているとAIは冗長になりがちです。論点を絞って「Aならこのメリット、Bならこのメリット」と制御するのもAIを使うスキルの一つですが、評価も決めやすい状態にしていくことが、これからの設計になるのでしょうか。

橋山様:そうですね。冗長さもそうですし、人間が理解しやすい簡素さも必要になります。一方で、本人に伝えるという意味では、なぜこういう形になったのかを情緒的に説明する、一定のナラティブが必要です。

判断者と本人に対して同じ見せ方がよいかというと、そうでもありません。そこをうまく使い分けるように、AIのプロンプトを飼い慣らしていく必要があります。

「監視されている」という懸念に、従業員の納得感をどう醸成したか

登壇者に質問を投げかける株式会社overflow 代表取締役 CEO 鈴木裕斗

――鈴木:ここは気になる方も多いと思います。AIとの壁打ちまで記録・分析されると、従業員に『監視されている』という懸念も出ると思います。こうした懸念に対して、従業員の納得感をどのように醸成していったのでしょうか。

橋山様:前提として、我々のカルチャーとして透明性を非常に重視しています。一部の機微・戦略情報などを除き、経営会議の内容も含めてすべてフルオープンです。そもそも情報は隠されるものではない、という前提がまずあります。

その上で、記録されることによるメリットの方が大きいと示されることが重要です。見られていないことで「この仕事をやったのに誰も見てくれなかった」となるよりも、「こんなことまで見てくれているんだ」という納得感を持ってもらう。「監視されている」から「見てくれている」に持っていけるかが肝だと考えています。

会社と個人が対立構造になると、やはり監視のように見えてしまいます。我々は性善説で組織を運営していることもありますが、ここもポイントです。

可視化されていることで、タスクの分量やパフォーマンスの低下にすぐサポートを受けられる、成果が出しやすくなる。そういう仕組みとセットで出すことで、監視されている感を和らげられるのではないかと思っています。

複数の職務を兼務している場合、どうスコアを算出しているか

――鈴木:橋山さんご自身もエンジニア・HRBP・AI推進を兼務されていますが、複数職務にまたがる場合はどうスコアを算出されているのでしょうか。

橋山様:評価期間を仮に半期とした場合、半期の中で一番の期待役割は何かをリーダーシップのメンバーと本人で合意し、それをメインの評価項目にしています。ただ、目標設定のような形にはしたくない、というのが我々の考えです。

目標を設定すると、事業の状況で上振れや下振れが起きたときに、目標を達成することが正義になってしまうからです。あくまで期待役割を設定し、それに対する成果の大きさを評価します。

想定していなかった成果が期待役割から外れたところで出ても、成果として出ているならきちんと評価します。逆に、期待役割を外れて成果が出ていないものは評価から外す、という考え方です。

私が3つの仕事でそれぞれ成果を出していれば評価されますし、工数が分散して小粒な成果しか出なければ、成果としては小さかったと評価されます。

人間による採点表の改善は、どのくらい必要だったか

質疑応答に答えるUbie株式会社 アクセラレーター本部 EM / HRBP / 生成AI推進室 橋山牧人氏

――鈴木:ヒューマン・オン・ザ・ループの話、非常に興味深いです。人間による改善は、これまで肌感覚でどのくらい必要でしたか。継続的に改善は必要になるのでしょうか。

橋山様:まだまだ改善が必要な余地は残されています。一番難しいのは貢献度の判断です。あることを3人、4人で成し遂げたときに、課題を設定した人の寄与率をどれだけ上げるべきか、設定しただけで実行していない場合に実行しきった人をどう評価するか。この配分は、AIで算出しても人間の感覚と合わない部分があります。

中長期の仕事の評価も難しい問題です。利益を生む基盤を作った人を、作った時点で評価するのか、そこから利益が出てから評価するのか。基盤を使う人と作った人が違う場合の按分はどうするのか。

こうした人間の考え方を、キャリブレーションとしてAIに伝える必要があります。そのため、採点表には今もなお改善を加えているところです。

現時点の肌感覚で言うと、AI単体で我々と同じ精度で出せている評価は全体の3割ほどです。残り7割のうち2〜3割は、人間が少しガイドラインを示せば出てきます。残りの3割は、どうガイドラインを示すかそのものが分かりづらい。

等級が高い人ほど、この傾向があります。等級が高い人は世の中にないものを課題設定していくため、AIの正解や基準に仕事の仕方が当てはまりません。その意味で、評価の精度が上がりづらい傾向が見えてきました。

直接売上を上げない基盤づくりや品質向上を、どう数値化しているか

――鈴木:直接売上を上げない基盤づくりや品質向上のような仕事は、成果としてどう数値化していますか。

橋山様:大きく2つの考え方があります。品質向上は歩留まりのような考え方で、品質が上がったことで将来発生していたであろう損失をどれだけ抑えたかを定量化し、数式にしています。

基盤づくりは、生産効率を上げたという捉え方です。基盤がないときとあるときで、プロダクトを作るスピードやかける人件費がどれだけ変わったかを計算式に当てはめて数値化しています。

人事評価をAIに任せてから、想定していなかった発見はあったか

――鈴木:最後に、人事評価をAIに任せてから、想定していなかった発見や、良い反応・悪い反応があれば教えてください。

橋山様:人間がどこを評価するかは、人によってかなり違うのだということが明瞭になってきました。面白い発見として、成果と能力のどちらに重きを置くかが結構割れます。

成果が出ることが重要で、能力は成果が出たことで証明されている、という人もいます。一方で、能力が成果の再現性になるからポテンシャルを評価する、という人もいる。人間の評価の中でも、ここが二分しているという気づきがありました。

おわりに

――鈴木:最後に、皆様に向けてメッセージがあればお願いします。

橋山様:Ubieは生成AIをいろいろな形で活用していますが、人事評価は非常にチャレンジングな領域です。自分自身、エンジニアや人事といった枠にとらわれず、活躍の幅を大きく広げられるチャンスだと感じています。

今日は人事や経営の方が多いと思いますが、組織の今までの枠や職種の枠にとらわれずにアサインを考えていくことが重要ではないでしょうか。皆様のお考えの参考になれば幸いです。

求人を出して待つ採用から、先に出会いにいく採用へ。

Offers AI RPOは、採用計画の策定から候補者選定・面談調整までAIと専門チームが伴走。転職市場に出る前のエンジニアにアプローチできます。

まずは無料で相談する

開催予定のイベント

AI時代の人事データ基盤のつくり方 〜XAION DATA × Offersで考える、分断された人事データをAIが扱える基盤に変えるまで〜

ハイクラスエンジニア採用の無料相談

オンライン(Zoom)/60分

求人・スカウト・エージェント、AIでの効率化まで進めても、CTO・VPoE・テックリードなどのハイクラスエンジニアの採用が決まらない。その原因がどこにあるのかを、採用中のポジションに該当する登録者の在籍状況とあわせて、一緒に整理します。情報収集の段階でも、お気軽にご利用ください。

よくあるご相談

  • ハイクラスの求人が数ヶ月動かない。何を変えれば決まるのか知りたい
  • いま転職を考えていない優秀なエンジニアに、どう会いに行くのか知りたい
  • 採用予算をお預かりし、使った分だけ課金・未消化分は全額返金する形(予算型リテーナー)の詳細を知りたい

支援実績(一部)

記事一覧へ

イベント・セミナー

イベント・セミナー一覧へ

お役立ち資料

3分でわかるOffers

3分でわかるOffers

ハイクラスエンジニアの最新トレンド〜Offersの機能・導入実績まで、3分間でご紹介!

資料ダウンロード
Offers採用成功事例集

Offers採用成功事例集

Offersを導入し、採用に成功された事例をご紹介。職種別の課題や工夫をご理解いただけます。

資料ダウンロード
AI RPOとは

AI RPOとは

AIエンジニア・テックリード・CTO——AI時代の希少人材採用に特化したRPOサービスをご紹介。AIと専門チームによる完全代行で、採用担当者はコア業務に集中できます!

資料ダウンロード
ストーリースカウトとは

ストーリースカウトとは

スカウト返信率が7年で半減したテンプレート型の限界を解説!候補者一人ひとりの文脈に合わせた「物語型」アプローチで、返信率・面談率を改善する新しいスカウト手法をご紹介!

資料ダウンロード
お役立ち資料一覧へ