TypeSafe AI が2026年9月15日に公開した「Jev」の解説記事は、1週間で出そろいました。仕様も料金も使い方も、日本語で読めます。
そろっていないのは、その先です。自分の部署の仕事に入れたら、どこまで任せられるのか。自分で測った記事も出てきましたが、題材は問い合わせの振り分けや社内記事の仕分けで、採用の工程で測ったものは見当たりません。
当社は9月19日から、社内の4つの仕事にJevを当てて、人が付けた答えとの一致率を測りました。結果は題材によって84.0%と55.0%に割れています。成立しなかった題材も、そのまま載せます。
測った4件に採用の工程は含まれていません。 内訳は、営業リードの仕分け、自社メディア記事の表記検査、社内記録のタグ付け、予定の色分けの4つ。採用の工程に当てはめる話は後半にありますが、それは実測ではなく、分かれ目から引いた見立てになります。
この記事は、その実測と、割れた理由をそのまま書いたものです。導入を勧める記事ではありません。同じ判断をする人が、自社で測る前に見立てを持てるようにするのが目的です。
先に結論を書きます。分かれ目は精度ではなく、判断の材料が渡す書類に書いてあるかどうかでした。この分かれ目は仕事の種類に依存しないので、採用の工程にも引けます。職務経歴書に書いてあること(使った技術・担当範囲・経験年数)の仕分けは任せられるはずで、書いていないこと(自社に合うか、入社後に伸びるか)は、確信度がどれだけ高く返っても当たりません。
Jevは文章を書かない。判定だけを返す
Jevは、文章を生成しないAIです。あらかじめ型を決めた問いに対して、確率つきの判定結果だけを返します。
当社の発表資料が挙げている判定の種類は、分類・振り分け・採点・抽出・分岐の5つです。応答時間は70〜500ミリ秒。既存の大規模言語モデルと比べて40〜200倍速いとされています。料金は入力100万トークンあたり0.042ドルで、出力には料金がかかりません。提供形態は動いています。9月20日時点のこの資料は早期アクセスと書いていますが、当社が本番の経路を提供元の直販へ切り替えた9月21日には、順番待ちなしで使える状態になっていました。
出所: 株式会社overflow「Offers、公開から5日の新AIモデル『Jev』をスキル登録に追加」(2026年9月20日公表)。提供形態は当社の社内記録(2026年9月21日時点)。
ここで押さえておきたいのは、Jevが「安い文章生成AI」ではないことです。文章を書かせる用途には使えません。使えるのは、答えが「はい/いいえ」か、決められた選択肢のどれかか、点数に収まる問いだけです。
投げられる問いは3種類しかない
公式ドキュメントが挙げている問いの型は3つです。
型 | 何を聞くか | 返るもの |
|---|
Noul | この記述は正しいか | 0から1の確率 |
Choice | 並べた選択肢から1つ選ぶ | 選んだ選択肢・各選択肢の確率・確信度 |
Score | 基準に沿って点数をつける | 点数・確率の分布・確信度 |
出所: TypeSafe AI 公式ドキュメント「Introduction」(2026年9月21日確認)。
採用の仕事に当てると、Noulは「この求人票は社内規定に反しているか」、Choiceは「この企業はどの業種か」、Scoreは「この応募は要件をどこまで満たすか」に当たります。
公式ドキュメントによれば、同じ状態に対して複数の問いが並行して評価されるとのことです。1件の応募に対して「必須要件を満たすか」「どの職種か」「どのチームに回すか」をまとめて聞く、という使い方になります。
大事なのは、どの型でも確率が一緒に返ることです。「はい」か「いいえ」だけが返るのではなく、どれくらい確からしいかの数字が添えられます。この数字があるからこそ、後で触れる「確信度で自動化の範囲を切る」が成り立ちました。
文章を読み取る工程が消える
返ってくる値はそのままプログラムが使えます。文章を読み取って意味を解釈する工程が要らないぶん、判定結果は条件分岐にそのまま渡せました。
生成AIに同じ仕事をさせると、「この応募は要件を満たしています」という文章が返り、そこから「満たす/満たさない」を取り出す工程が挟まります。書式を指定しても、指定どおりに返らないことがあります。指定外のことを書き足してくる場合もあるでしょう。判定だけが欲しい場面では、この工程は失敗する余地を増やすだけです。
速度上限は、当社が使っている直販の経路で1分あたり1,200リクエスト、1リクエストあたり6万4千トークンです(提供元は需要に応じて変わると明記しています)。採用の実務で扱う件数、たとえば1日数十件から数百件の応募や企業の仕分けなら、上限に当たる心配はまずありません。
採用・人事の仕事は「書く」より「仕分ける」が多い
採用の業務を工程に分けると、文章を書く仕事はそれほど多くありません。多いのは仕分けです。
この応募は要件に合うか。この企業は今回の対象か。この求人票の表現は社内規定に反していないか。この問い合わせは誰に回すか。どれも答えは決まった選択肢の中にあります。
こうした仕事に生成AIを使うと、返ってきた文章から答えを読み取る工程が挟まります。読み取りに失敗することもあれば、聞いていないことまで書いてくる場合もあるでしょう。判定だけが欲しい場面では、その工程は余計です。
だから当社は、生成AIを入れる前に、判定専用のモデルで足りる仕事がどれだけあるかを測ることにしました。測ったのは、社内で先に正解データが揃っていた4件です。採用の工程そのものは入っていませんが、答えの形(決まった選択肢のどれか)は同じなので、向き不向きの分かれ目は共有できます。
4題材の結果、一致率は84.0%と55.0%に割れた
正解には人が付けた答えを置き、4つの題材で一致率を測りました。
題材 | 何を仕分けたか | 母数 | 生の一致率 | しきい値で足切りしたとき | 判断 |
|---|
会社の業種判定 | 営業リードの会社がテック企業か | 50件 | 84.0% | 確信度0.80以上で35件中35件(対象の70.0%) | 実務に載せた |
表記規定の違反検知 | 自社メディア記事の表現が社内規定に反していないか(50件中25件は自作の検証文) | 50件 | — | 違反の確率0.80以上で15件中14件を検出・誤検知0件 | 実務に載せた |
記録の領域タグ付け | 社内の作業記録がどの領域の話か | 120件 | 80.0% | 確信度0.70以上で92.1%(対象の74%) | 使える水準(実装は未) |
予定の色分け(6値) | カレンダーの予定が社外か社内か個人作業か | 149件 | 55.0% | 確信度0.70で61.2%、0.80で59.7% | 見送った |
出所: overflow調べ(2026年9月19日から9月21日の社内実測・n=50 / 120 / 50 / 149)。
同じモデルを、同じ使い方で当てています。それでも結果はここまで割れました。実際に運用へ入れたのは上の2つで、3つ目は水準に届いたものの実装はまだです。
会社の業種判定は、確信度0.80以上で誤りが消えた
問い合わせをくれた会社が、自社でソフトウェアを開発しているテック企業かどうかを判定する工程です。営業の対象になるかの見極めに使っており、採用の募集対象を探す工程ではありません。各社サイトのクロール本文を材料にして、人が作った基準の判定を正解として照合しました。
生の一致率は84.0%でした。ここから確信度で足切りすると、0.80以上では35件中35件が正解になります。対象は全体の70.0%です。0.70まで下げると38件中37件で97.4%、対象は76.0%まで広がります。
外した8件はすべて確信度0.77以下でした。うち6件は0.61以下です。中身を見ると、自社Webサービスと人材紹介を両方やっている会社や、電気商社でソフトウェアも作っている会社でした。人が見ても判断が割れる類です。
表記規定の違反検知は、言い換えた文も捕まえた
自社メディアに出す記事が、社内の表記規定に反していないかを見る工程です。当社の規定は4条あり、雇用形態・採用対象・提供を終えたサービス名・構想段階のサービス名について、書いてよい範囲を決めています。検査したのは記事の本文で、求人票は含んでいません。
規定に反する文15件と、反しない文35件を用意しました。このうち25件は検証のために自作した文です(違反例15件すべてと、違反でない文のうち10件)。残る25件は公開済みの自社記事の本文をそのまま使っています。違反の確率が0.80以上のときだけ書き手に警告を出す設定で、15件中14件を検出し、35件での誤検知は0件でした。
数字の読み方に注意が要ります。15件中14件は、自分で書いた違反例に対する検出率です。 実際に世に出た違反を捕まえた率ではありません。誤検知0件のほうは、25件が実物の記事なので実地に近い数字です。
数字よりも実務で大きかったのは、語の一致では見つからない言い換えを捕まえたことです。検証データには、禁止語をひとつも使わずに同じ訴求をする文を混ぜてあります。たとえば、雇用形態の語を避けたまま、月20時間の稼働から入って雇用契約を結ばずに実力を見る、という進め方を利点として書いた文です。語のリストで検査していた従来の仕組みでは通っていた型で、これを検出できるようになりました。
規定に反しない文の最高値は0.43、反する文の最低値は0.76でした。あいだに0.33の余白があります。
記録の領域タグ付けも、8割から9割へ上がった
社内の作業記録に、どの領域の話かを示すタグを付ける工程です。正解は本人が手で付けたタグで、120件を照合しました。
生の一致率は80.0%です。確信度0.70以上に絞ると92.1%まで上がり、対象は全体の74%が残ります。
採用の工程ではありませんが、業種判定と同じ形になりました。材料の性質が同じだったからです。記録の本文には主題が書かれています。読めば分かることを聞いているので、確信度が高いものは実際に正しい、という関係が成り立ちました。
予定の色分けは、確信度を上げても届かなかった
見送った題材です。カレンダーの予定を6種類に色分けする仕事で、判定にかけたのは326件。うち既存の決定論ルールでは判定できない149件が、置き換えたかった範囲です。正解は本人が過去120日に手で色を付けた1,033件から取っています。
ルールが判定できる177件では93.2%まで出ました。ところが、ルールが判定できない149件では55.0%です。ここが置き換えたかった範囲でした。
確信度で足切りしても上がりません。0.70で61.2%、0.80で59.7%。0.99まで上げれば83.3%になりますが、対象は全体の16%だけです。誤りの最多は、社外の打ち合わせを社内の打ち合わせと判定したもので26件、個人作業と判定したものが21件でした。
分かれ目は、渡したテキストに答えが書かれているかどうかだった
4つを並べると、差を作っていたのはモデルの性能より入力の側でした。
会社の業種判定で渡したのは、各社サイトの本文です。事業内容はそこに書かれているので、読めば分かります。表記規定の検知で渡したのも、検査したい文章そのものです。記録のタグ付けも同じで、主題は本文に書かれています。
一方、予定の色分けで渡したのはカレンダーのタイトルだけでした。取引先の略称や相手の呼び名しか入っていない予定が社外の打ち合わせかどうかは、書いた本人の記憶にしかありません。材料に答えが無いのです。
ここから言えることが2つあります。
ひとつは、選択肢を列挙できることは必要条件でしかないということ。6種類に分けられるから任せられる、とはなりません。分ける材料が渡すテキストの中にあるかどうかが、十分条件のほうです。
もうひとつは、確信度が信用できるのも、根拠が入力の中にある場合だけだということ。根拠があるときは、確信度が高いほど正しくなります。根拠が無いとき、モデルは自信を持って間違えます。予定の色分けで閾値を上げても精度が上がらなかったのは、この型でした。
「型から外れた値が返らない」ことと、「判定が正しい」ことは別
判定専用モデルの説明でよく出てくるのが、出力が型に収まるという話です。選択肢を3つ与えれば、返るのはその3つのどれかです。存在しない4つ目を作ることも、聞いていないことを書き足すこともありません。生成AIに書式を指定しても指定どおりに返らないことがある、という悩みは消えます。
ここを「だから間違えない」と読むと、採用の工程では危険です。型に収まることと、中身が合っていることは別の話です。
当社の実測がそれを示しています。予定の色分けで返るのは、設計上かならず与えた6つの選択肢のどれかです。それでも149件のうち45%は違う色でした。しかも確信度を上げても正答率は上がりません。材料に答えが無いとき、モデルは型に収まったまま、自信を持って間違えます。
採用に当てはめると、「要件を満たす/満たさない」の2択で返ってきた値は、必ずどちらかです。形式が整っているぶん、そのまま信じやすくなります。確かめるべきなのは形式ではなく、その判断の材料が渡した書類にあるかどうかです。
生成AIと判定専用モデルは、置く場所が違う
どちらかを選ぶ話ではありません。工程ごとに置き分けます。
工程の例 | 向くもの | 理由 |
|---|
スカウト文面の下書き | 生成AI | 文章を作る仕事で、答えが型に収まらない |
応募内容の要約 | 生成AI | 出力が文章そのもの |
対象企業の仕分け | 判定専用 | 答えが決まった選択肢の中にある |
求人票の表記チェック | 判定専用 | 答えが「反している/いない」の2値 |
問い合わせの振り分け | 判定専用 | 回す先が決まっている |
人事領域全体でAIがどこに入っているかはAI人事とは?人事のAI利用39%、5領域と法規制で整理しました。実務では、両方を直列に置くことが多くなります。判定専用モデルで件数を絞り、残ったものだけを生成AIか人に回す形です。当社の業種判定がその形です。n=50 の検証で確信度0.80以上が70.0%を占めたので、設計上は後段に回る件数が3割になります。運用後の実件数はまだ測っていません。
順序を逆にすると、安いほうの利点が消えます。全件を生成AIに通してから仕分けても、かかる費用は変わりません。安い判定を前に置くから費用が下がります。
採用の工程に当てはめると、向く仕事と向かない仕事が分かれる
ここから先は実測ではありません。測った4件に採用の工程は入っていないので、分かれ目だけを持ち込んだ見立てです。 自社で試すときは、この見立てを鵜呑みにせず、後半の手順で測ってください。
そのうえで線を引くと、向き不向きはかなりはっきり分かれます。
向くのは、書類に書いてあることの突き合わせ
職務経歴書に書かれていること、たとえば使った技術、担当した範囲、経験年数は、すべて書類の中にあります。要件と突き合わせて仕分ける工程は、材料が足りているはずです。当社が実務に載せた会社の業種判定も、サイト本文に事業内容が書いてあるから成立した型でした。構造は同じです。
求人票の表記チェックも向くと見ています。検査したい文章そのものを渡すので、材料が欠けることがありません。当社が測ったのは自社メディアの記事でしたが、そこでは禁止語を避けて言い換えた文まで捕まえました。求人票の表現が社内の方針や法令の線を越えていないかを見る工程も、語のリストでは取りこぼしが出ます。
問い合わせや応募の振り分けも同じ型です。本文に「どの職種か」「どの段階の相談か」が書かれていれば、回す先は決められます。採用に絞った他社の導入実績はAI採用とは?工数80%削減・承諾率2.4倍、7社が実証したAI活用効果とリスクにまとめてあります。
共通しているのは、判断の根拠が1つの書類の中で完結していることです。他の情報を持ってこないと決められない仕事は、この列に入りません。
向かないのは、書類に書かれていないことの推測
自社の進め方に合うか。入社後に伸びるか。チームとうまくやれるか。これらは職務経歴書に書かれていません。書かれていないことは、どれだけ確信度が高く返ってきても当たらないでしょう。
そして当社は、この仕組みを採用の合否判断には使っていません。 使っているのは、営業リードの仕分けと、自社記事の表記検査の2つだけです。判定を人の判断の代わりに置くと、なぜ落としたのかを説明できなくなります。手前の工程を減らすことと、判断そのものを渡すことは、効果の大きさも説明責任の重さも別物です。
AIを入れる前に確認すべきなのは、精度の数字ではありません。その判断の材料が、渡す書類に書いてあるかのほうです。ここが決まらないと、出てきた数字の意味も決まりません。
自社の採用がどの工程でつまずいているかを外形的に見るには、エンジニア採用力チェックが使えます。5つの指標で募集から入社までの状態を採点するので、仕分けを機械に渡す前に、どこに手をつけるべきかを確かめられます。
判定を間違えたときに何が起きるかで、置く場所を決める
向き不向きは、もうひとつの軸でも見ておきたいところです。間違えたときの後始末です。
業種の判定を間違えると、対象外の企業が候補に残ります。後工程で人が見れば気づきますし、気づかなくても失うのは1件ぶんの手間です。求人票の表記検査を間違えると、書き手に不要な警告が出ます。うるさいだけで、公開前に人が判断すれば済む話でした。
一方、応募の仕分けを間違えると、本来会うべきだった人に会わないまま終わります。後工程で気づく機会がありません。落としたことは記録に残っても、落とさなければどうなったかは誰にも分かりません。
だから当社は、間違いが後工程で拾える場所にだけ置いています。拾えない場所に置くときは、精度がいくら高くても人が全件見る設計にしました。
自動化の範囲は、確信度で切って決める
実務に載せた題材では、確信度で線を引いて役割を分けています。
会社の業種判定では、0.80以上を自動で確定し、それ未満だけを後段へ回しました。この線引きで、後段に回る件数は3割になります。残りの7割は人もより高価なモデルも触りません。
表記規定の検知は、片側だけを使う運用にしました。違反の確率が0.80以上のときだけ警告を出し、「違反ではない」側は何も起こしません。誤検知は書き手の手を止めるので、確信が高いときしか鳴らさない設計です。
線の引き方は題材ごとに変わります。移せるのは数字ではなく、確信度の高い範囲と低い範囲で正答率がどれだけ違うかを、自社の実データで先に測るという手順のほうです。
切り替える前に、しばらく両方を動かす
線を引いたあと、いきなり置き換えてはいません。しばらくのあいだ、従来の工程と判定を両方動かして、食い違った件だけを見ます。
見るのは2つです。食い違った件が、確信度の低い側に寄っているか。寄っていれば、線の位置を変えるだけで済みます。寄っていなければ、材料が足りていないので、線をどこに引いても解決しません。
当社の業種判定では、外した8件がすべて確信度0.77以下に寄っていました。だから0.80で切るという判断ができています。予定の色分けでは寄っていませんでした。だから見送りました。同じ実測から、採用と不採用の両方の結論が出ました。
採用の工程でこれをやるなら、過去の書類選考の結果をそのまま使えるでしょう。新しく人手をかけずに、食い違いの分布だけ見れば判断がつきます。
精度を決めるのは、モデルではなく問いの書き方だった
4題材を通して、手を入れる余地がいちばん大きかったのは問いの文でした。
判定専用モデルに渡すのは、聞きたいことと、正しい場合と正しくない場合の基準文です。この基準文が曖昧だと、材料が足りていても答えが揺れます。
当社の表記規定の検査を例にすると、最初は「この文章は社内規定に反しているか」とだけ聞いていました。これでは、過去の経緯を振り返っているだけの文まで拾います。基準文を「提供を終えたサービスを、今も提供しているかのように読者へ勧めている」「終了した経緯を記録として説明しているだけなら反していない」と書き分けてから、誤検知が消えました。
採用の工程で言えば、「この応募は要件を満たすか」では足りません。満たすとはどの状態か、満たさないとはどの状態かを、書類に書かれている言葉で書き分ける必要があります。これは要件定義そのものです。
ここに時間をかけた副産物として、社内で曖昧だった基準が言葉になります。人が判断していたときは「見れば分かる」で済んでいたものが、書き出してみると人によって違っていた、ということが起きます。機械に渡せるかどうか以前に、この作業自体に意味がありました。
問いと基準文は、1箇所にまとめて置いています。複数の工程が同じ基準を使うので、書き換えたときに片方だけ古くなるのを防ぐためです。
止まらない設計と、判定を素通りさせない設計
運用では2つを決めています。
ひとつは、判定が落ちても業務を止めないこと。鍵の失効も通信の失敗も起こります。判定が返らなければ、従来どおり全件が後段へ流れるようにしてあります。速くするための仕組みが、止まる理由になってはいけません。
もうひとつは、判定結果をそのまま確定させないこと。別のプログラムが、許可された値の範囲に収まっているかを検証してから使います。どれを機械が決めたのかも記録に残してあり、後から辿れる状態にしました。
採用の文脈では、2つ目のほうが重くなります。誰の応募が、どの工程で、何を根拠に絞られたのか。記録が無いと、後から説明できません。
費用は、判断を試す規模では問題にならない
料金は入力100万トークンあたり0.042ドル、出力は無料です。
実費で言うと、予定の色分けの検証(326件を2回)にかかったのは約0.02ドルでした。使えるかどうかを測るだけなら、費用は判断材料になりません。先に重くなるのは、正解データを人が用意する手間のほうです。
当社の4題材でも、時間がかかったのは判定そのものではなく、正解を作る工程でした。過去120日ぶんの手作業の記録や、人が作った判定基準が既にあったから測れています。正解が無いところでは、精度を測ること自体ができません。
採用の工程で正解にできるものを探すと、たいてい既にあります。過去に人が書類選考で付けた合否。スカウトを送った企業と送らなかった企業。求人票のレビューで差し戻した箇所。これらは業務の副産物として溜まっていて、正解データとして使える形に近い状態にあります。
件数の目安は、当社の4題材では50件から150件で判断がつきました。同じ規模を勧める記事は他にもあります。ここで見るのは全体の一致率ではなく、確信度の高い範囲と低い範囲で正答率がどれだけ違うかです。差が出れば自動化の線が引けます。差が出なければ、材料が足りていないので、件数を増やしても結論は変わりません。
採用要件としての Jev
最後に、労働市場の側の動きにも触れておきます。
当社は2026年9月20日に、Jevを Offers のスキル登録に追加しました。求職者がプロフィールに登録でき、企業がオファー送信や募集の際にスキル条件として指定できます。公開から5日での対応です。
生成AIに言及する正社員求人は、2023年の1.6%(14/897件)から2026年の43.6%(249/571件)へ増えました。2026年は9月初旬までの集計です。
出所: Offers調べ(BigQuery job_description_profiles の集計・正社員のみ・2026年9月6日取得)。
年ごとの内訳と、言及した求人に応募が何倍つくかはAI活用事例の現在地は?導入58.0%と求人の変化で扱っています。新しいモデルが出てから、それを扱える人を求人票に書けるようになるまでの時間は、以前より短くなっています。採用要件を決める側から見ると、技術の選定と求人要件の更新が、ほぼ同時に来るということです。事業側が試している段階で、人事側も要件を動かせるかどうかが問われます。
先に確かめるのは精度ではなく、判断材料の所在
Jevは、文章を書かずに判定だけを返すAIです。分類・振り分け・採点のような、答えが型に収まる仕事に向きます。
当社が4題材で測った結果は、84.0%と55.0%に割れました。分かれ目は、判断の根拠が渡したテキストの中にあるかどうかです。
採用の工程に当てはめると、職務経歴書に書いてあること(技術・担当範囲・経験年数)の突き合わせは仕分けられます。書いていないこと(自社に合うか、伸びるか)は当たりません。合否そのものは渡していません。
自社で試すなら、順序は次のとおりです。まず、その判断の材料がどの書類に載っているかを確かめる。次に、人が付けた正解を用意する。そのうえで、確信度の高い範囲と低い範囲で正答率がどれだけ違うかを測る。精度の数字を他社から借りても、自社の材料が違えば結果は変わります。