AI利用量を評価してはいけない?Metaの『tokenmaxxing』が示した人事評価の罠

記事解剖

会社が社員にAIを使わせたい。

2026年現在、多くの企業にとって、これはかなり切実な課題のようで、生成AIを導入しても社員が使わなければ生産性は上がらん、と頭を抱える経営者もいるようです。

ならば、「AIを積極的に使う社員を高く評価すればいい」と考えるのは、一見すると合理的です。

ところが、この方法をかなり積極的に進めていたMetaで、非常に興味深い現象が起きた、という記事を発見したので深堀りしたいと思います。

WIREDが2026年9月2日に報じたところによれば、Metaは社員の人事評価において、AIツールの利用量や「AI Native」といった評価を重視する方向から後退し、今後はAI利用ダッシュボードやトークン数を「impact」の評価には使わない方針を社員へ示しました。

Meta Pushes Its New AI Agent on Employees—but Eases Off on Tokenmaxxing
The company is reducing pressure on workers to use artificial intelligence tools while encouraging them to experiment wi…

Meta側は一貫して社員の貢献を評価してきたとしており、「AI Native」などのラベルが正式な人事評価に使われたことも否定しています。

なぜでしょうか。

社員がAIを使わなかったからではありません。

むしろ逆です。

一部の社員が、「AIをたくさん使った人間ほど評価されるなら、とにかくAIをたくさん使おう」と合理的に適応し始めたからです。

AIへ意味の薄い質問を何度も行い、消費トークンを増やす。

内部ではAI利用量を競うランキングまで作られ、「Token Legend」といった呼び名まで登場しました。

この現象は社内で「tokenmaxxing」と呼ばれるようになりました。

以前、記事解剖室では、

「人事評価制度は社員の働きぶりを測るだけではなく、社員の働き方そのものを変えてしまう」と考察しました。

人事評価はなぜ社員の行動を歪めるのか?働いているフリ・成果主義・AI評価から考える
人事評価はなぜ社員の行動を歪めるのか、働いているフリ・成果主義・AI評価から考察しています。

会社が「これを評価します」と宣言した瞬間、社員は「では、それを増やせば評価される」と考えます。

今回のMetaで起きたことは、その仕組みを非常に分かりやすく示しているのではないでしょうか。

今回はWIREDの記事を入口として、AI時代に会社は何を評価すべきなのか。

そして、なぜ「AIを使っているか」を評価すると、「AIを使って仕事を良くする」という本来の目的から離れてしまうのかについて考えてみたいと思います。


記事は何を主張しているか

WIREDの記事を非常に単純化すると、

Metaは社員にAI利用を強く求めてきたが、AI利用量そのものを人事評価へ結び付ける方向から後退し始めた。

という記事です。

約1年前、Metaでは社員に「AI-driven impact」が求められるようになり、日常業務でチャットボットやAIエージェントをどの程度活用しているかが意識されるようになりました。

しかし2026年9月に示された新しい評価指針では、「AIをどれだけ使ったか」ではなく、

  • アウトプットの質
  • 仕事の速度
  • 解決した問題の難易度
  • 担った仕事の範囲

などを重視する方向が改めて示されています。

つまり、AI利用を目的にするのではなく、AIを使った結果として何を生み出したのかを見ようという方向への修正です。

これは非常に重要な違いです。

例えば、

社員A
AIを100万トークン使って仕事を10個終わらせた。

社員B
AIを10万トークン使って同じ仕事を12個終わらせた。

社員C
AIをほとんど使わず、専門知識によって15個終わらせた。

会社が欲しいのは、「AIを一番使った社員」でしょうか? おそらく違います。

会社が本当に欲しいのは、最も大きな価値を会社にもたらした社員のはずです。

ところがAI利用量を評価項目に入れた瞬間、社員Aが社員BやCより評価される可能性が生まれてしまいます。

ここに今回の問題があります。


筆者は誰に向けて書いているか

WIREDの記事は表面的には、Metaや生成AIに興味を持つ一般読者、テクノロジー業界の関係者、AIを導入している企業、そしてAIによって働き方が変わりつつある労働者、あたりを対象としていると思います。

しかし、もう一段深く読むと、「AIを導入すれば会社が自動的に生産的になる」と考えている企業経営者や管理職に向けた記事として読むこともできます。

現在、多くの企業が社員へAI利用を求め始めています。

ところが企業側には、「AIを使え」という号令を出した後に必ず生じる問題があります。

それは、本当に使っているのかどうやって確認するのかという問題です。

AI利用率、生成回数、トークン数、AIによるコード生成率、AIツールのログイン日数、これらは全部数字として測れます。

だから管理しやすい。

逆に、「AIによって社員の判断力がどれだけ向上したか」「AIによって仕事の品質がどれだけ改善したか」「AIを使うべき仕事と使わない方がいい仕事を適切に選別できているか」などは簡単には数値化できません。

その結果、測れるものを評価したくなる。

しかし、測りやすいものと、会社が本当に欲しいものは同じとは限らない。

今回の記事は、その危険を示しています。


読者に何をさせたいか

この記事は、「AI利用をやめろ」という記事ではありません。

むしろMetaは現在もAI利用そのものについてはかなり積極的です。

同社では新しいAIエージェント「Hatch」の社内テストも進められており、社員のAI利用量そのものは依然として大きいとWIREDは報じています。

つまりMetaが後退したのは、AIを使うことではなく、AIを使った量を人間の価値の代理指標として扱うことなのだと思います。

これはかなり重要な違いです。

会社としては、AIを使ってほしい。

しかし、AI利用量を評価するとおかしなことが起こる。

ではどうするのか。

答えはおそらく、「AIをどれだけ使ったか」ではなく、「AIも含めた道具を使って何を実現したのか」を評価する。

というところに戻ってきます。

実際、Metaが新たに示した考え方も、AI利用そのものではなくアウトプットの質や速度、問題の複雑さなどを見る方向です。


どんな前提を置いているか

今回の記事には、いくつか重要な前提があります。

前提1.AI利用量とAI能力には相関がある

まずMetaがAI利用を強く促したこと自体は理解できます。

AIは新しい道具です、使わなければ上手くなりません。

毎日AIを使っている社員と、一度も触っていない社員なら、一般論として前者の方がAI活用能力を身につける可能性は高いでしょう。

だから、AI利用量→AIへの習熟→生産性向上

こういう仮説自体は、それほどおかしくありません。

問題は、この関係が一直線ではないことです。

AIを100回使った人が、10回使った人の10倍仕事ができるわけではありません。

むしろ一定以上になると、

「AIを使う必要のない仕事までAIへ投げる」という逆転現象すら起こります。

そこでtokenmaxxingが生まれます。


前提2.社員は会社の意図通りに評価指標へ反応する

企業側はおそらく、

「AI利用を評価する」→「社員がAIを積極的に使う」→「AI能力が高まる」→「会社の生産性が高まる」という流れを期待したのでしょう。

ところが社員側から見れば、評価制度は違って見えます。

「AIを使うと評価される」→「AI利用量を増やせば評価される」→「では利用量を増やそう」となります。

会社は、AIによる生産性向上を求めている。

社員は、人事評価の向上を求めている。

ここには微妙なズレがあります。

評価制度がうまく設計されていれば両者は一致します。

しかし制度設計が悪ければ、会社にとって最適な行動と、社員個人にとって最適な行動が食い違ってしまいます。

……と言うか、正直に言います(-_-;)

この記事をAIが探し当てた時、私は頭を抱えて『……マジかよ』と呟いていました。

こんな『AI利用を評価する』なんて人事制度を設計したら、AIが不要な簡単な事柄でもテキトーにAI使いだして、余計に手間がかかる、それに伴いまともな人事評価が出来なくなる、ということくらい、設計者は考え付かなかったのか、と(-_-;)

Meta社の社員の職種や役職、担当する領域によって年収に大きな幅がありますが、一般的なエンジニアでも約3,000万〜5,000万円以上、トップAI人材や幹部クラスになると数億〜150億円規模の破格の報酬が提示されることもあるとのことですが……

年収450万の工場勤務の社員でも『オイ待て、それは絶対マズイことになるぞ』とすぐに気付けるものを、何倍ものお金を貰っている人達でも気付けないもんなのか、と暗澹たる気持ちで首を傾げていますort


前提3.数字は客観的で公平である

もう一つ見逃せないのが、数値評価への誘惑です。

上司による評価には主観があり、好き嫌いも入ります。

部署間で評価基準も違います。

その点、「AIを何回使ったか」「何トークン消費したか」なら客観的に見えます。

しかし、それが公平とは限りません。

2026年7月にはMetaの社員26人が、AI利用量などを含むアルゴリズム的な評価が5月のレイオフに利用され、医療・育児・家族関連の休暇を取った社員が不当に不利になったとして提訴しています。

Meta側はこの主張を否定し、「人員や組織に関する決定はAIではなく人間が行った」としていますので、現時点では訴訟側の主張であることには注意が必要です。

しかし問題提起としては重要です。

例えば半年間働いた社員と、そのうち3カ月を育児休暇で休んだ社員を、単純なAI利用量で比較すればどうなるでしょう。

後者が低くなるのは当然です。

つまり、正確に測定された数字でも、測定条件が違えば公平な評価にはならないのです。


何が書かれていないか

WIREDの記事には書かれていない、あるいは十分に掘られていない問題があります。

書かれていないこと1.これはAI固有の問題ではない

今回の現象を見ると、「AI利用量を人事評価に使ったから失敗した」ように見えます。

しかし本質はAIではありません。

以前の記事解剖室で考察した、「人事評価はなぜ社員の行動を歪めるのか?」と完全に同じ問題です。

会社が、「残業している社員は頑張っている」と評価すれば、社員は仕事を早く終わらせなくなるでしょう。

営業件数を評価すれば、質の悪い営業まで増えます。

改善提案件数を評価すれば、小さな改善案を大量に提出する社員が出てきます。

処理件数を評価すれば、難しい案件を避けて簡単な案件ばかり処理する人が出てきます。

そして、AI利用量を評価すれば、AIを使う必要のない仕事までAIを使うのは当然です……本当に、Metaの制度設計者は、なんでこんな簡単に思いつく欠陥を思いつかなかったんだろうか(-_-;)

これはいわゆるグッドハートの法則、「指標が目標になると、その指標は良い指標ではなくなる」という問題と非常によく似ています。

今回のtokenmaxxingは、そのAI時代版と言ってよいでしょう。


書かれていないこと2.「AIを使わない能力」もAI能力である

これは意外と重要だと思います。

AI時代の優秀な社員とは、何でもAIに任せる社員なのでしょうか。

おそらく違います。

本当にAIを使いこなす人は、「これはAIにやらせる」「これは自分で考える」「ここまではAIに作らせる」「最後の判断は人間がする」と使い分けます。

私も、このブログを運営するにあたり、ネタ探しはAI、プロンプトを練って出力して貰うことで、記事の大部分もAIに任せていますが、こんな感じで、私が感じたこと、そこはおかしいと思ったことなどは挿入、ないしはカット、修正などしています。

つまり、AIを使う能力だけでなく、AIを使わない判断能力もAIリテラシーの一部なのです。

ところがAI利用量を評価すると、「AIを使わない」という正しい判断が、人事評価上はマイナスになる可能性があります。

ここでも会社の目的と評価制度が衝突します。


書かれていないこと3.評価指標がAIコストそのものを増やす

tokenmaxxingにはもう一つ面白い矛盾があります。

生成AIは無料ではありません。

AIを大量に使えば、計算資源も電力もサーバーも、最終的には企業の費用になります。

社員にAI利用量を競わせた結果、本来必要ではないAI処理まで大量に発生すれば会社は、社員にコストを浪費させるインセンティブを自分で作っていることになります。

「コピー用紙をたくさん使った社員ほど高評価」と言われたら、どうです?

紙を大量に無駄遣いする社員が現れるでしょうが、社員は自身の社内評価を高める最善の行動をしているに過ぎませんが、でも実にバカらしい(-_-;)

AIでは、その紙が「トークン」になっただけとも言えます。


記事の有効な部分は何か

今回の記事で最も価値があるのは、AI時代の人事評価の失敗を、具体的な企業行動として可視化したことだと思います。

記事解剖室ではこれまで、「AIに評価される社員は、『AIを攻略する働き方』を始めるのか?」という問題も考えてきました。

AIが社員を評価するようになれば社員は、「良い仕事をする方法」だけでなく、「AIから高得点を取る方法」を研究するようになる可能性があります。

似たような事柄は以前にも考察していますので、興味がある方は以下の記事も参考になるかもしれません。

AIに評価される社員は、「AIを攻略する働き方」を始めるのか?
AIに評価される社員は、「AIを攻略する働き方」を始めるのか考察しています。

今回のMetaではAIそのものが人事評価者だったわけではありません。

しかし、AI利用量という数値が評価と結び付くと認識されたことで、社員が評価指標そのものを攻略し始めました。

構造はまったく同じです。

つまり今後企業がAIを人事評価へ導入する際、最大の問題はAIが正しく社員を測れるかだけではないでしょう。

もう一つ、社員がその測定方法を理解した後、どう行動を変えるかを考えなければなりません。


別の立場から見るとどうなるか

経営者から見ると

経営側からするとMetaの試みは、それほど馬鹿げたものではありません。

AIが企業競争力を左右すると考えているなら、社員へAIを使わせる必要があります。

しかし社員は新しい道具を嫌がることがあります。

そのため、研修する、利用環境を整える、利用量を測る、評価へ反映するという流れは自然です。

今回、問題になってしまったのは、詰めの一手を誤ったことです。

AI利用促進のKPIと人事評価のKPIを、同じものにしてしまった。

企業として、「社員の70%にAIを一度使ってもらう」ならAI利用率は良い指標です。

しかし、「誰が優秀な社員なのか」を決める指標としてAI利用率を使えば、意味が変わります。

つまり組織変革を進めるための指標と、人間を評価する指標を混同してはいけないということなのでしょう。


社員から見ると

社員側からすればtokenmaxxingは、ある意味非常に合理的です。

会社が評価するものを増やす、これは社員として当然の行動でしょう。

むしろ「AI利用量が評価に関係するかもしれないのに、利用量を気にしない」社員の方が、人事戦略としては危険かもしれません。

ここが評価制度の恐ろしいところ。

会社から見ると、「社員が評価制度を悪用している」ように見えます。

しかし、社員から見るとどうでしょう?

「会社が提示したルールの中で合理的に行動しているだけ」なんです。

以前の記事解剖室では、会社が評価制度を作ると社員は仕事だけでなく、評価制度そのものを攻略するようになると考察しました。

今回のtokenmaxxingは、その典型例ではないでしょうか。


管理職から見ると

管理職にとってAI利用量は魅力的な数字です。

部下一人ひとりの仕事を詳しく見るのは大変です。

しかしダッシュボードなら「誰がAIを使っているか」を一瞬で確認できます。

だからこそ危険です。

測定コストが低い数字ほど、管理に使いたくなります。

しかし本当に見るべきなのはAI利用量ではなく、AIによって仕事が早くなったのか。

品質が上がったのか、ミスが減ったのか、顧客満足度が上がったのか、新しい価値が生まれたのかという結果です。

つまりAI時代になっても、最終的には管理職が仕事を見る能力から逃げることはできないのかもしれません。


記事解剖室の結論

今回のMetaのtokenmaxxingから得られる教訓は、

単純に、AI利用量を人事評価に入れてはいけないではないと思います。

もっと一般化できます。

会社が社員に求める「手段」を評価すると、社員は目的ではなく手段を最大化し始める。

ここが重要です。

Meta社が本当に求めていたものは、AI利用量ではなかったはず。

生産性、品質、顧客価値、新しいアイデア、より良い意思決定。

そうした成果を生み出すための手段としてAIを使いましょう……Meta社の、この制度設計をした人は、多分そう考えていたはずです。

ところが、

AIを使わせたい→AI利用量を測る→AI利用量を評価する→社員がAI利用量を最大化する→AI利用量と会社への貢献が分離する

こういう現象が起きた。

これがtokenmaxxingの本質でしょう。

そして、この問題は昨日まで記事解剖室で考えてきたMetaのAI組織改革ともつながっています。

MetaではAIを利用した開発効率化と組織縮小が進められる一方、AIへの依存によるバグ増加やエージェント開発の遅れなどが報じられ、追加の大規模人員削減計画が取りやめられたとも報じられています。WIREDの記事でも、Hatchによって生産性が上がれば再び人員削減につながるのではないかと不安視する社員の声が紹介されています。

ここには共通する問題があります。

AIでコードを書く量を増やす。

AIを使う量を増やす。

AIによって一人あたりの仕事量を増やす。

どれも数字としては測りやすい。

しかし、「会社が本当に強くなったのか」は、それだけでは測れません。

以前の記事解剖室で、「人事評価制度は社員を測定する装置であると同時に、社員の行動を設計する装置でもある」と考察しました。

今回のMetaの事例を見ると、もう一つ付け加えてもよいと思います。

人事評価制度とは、会社が社員に対して発する『この会社では、何をすれば合理的なのか』というメッセージでもある。

AI利用量を評価すれば、「AIをたくさん使うことが合理的だ」と社員へ教える。

短期成果だけを評価すれば、「長期的な仕事は後回しにすることが合理的だ」と教える。

個人成果だけを評価すれば、「同僚を助けるより自分の数字を作る方が合理的だ」と教える。

だから評価制度を作るとき企業が考えるべきなのは、「何を測れば社員を正しく評価できるか」だけではありません。

もう一つ、「この指標を評価対象にした瞬間、合理的な社員はどんな行動を始めるだろうか」と考える必要があります。

AI時代には、仕事のあらゆる部分が数値化されていくでしょう。

AI利用回数。

トークン数。

生成コード量。

処理件数。

回答速度。

AIによる生産性推計。

数字が増えれば、企業は人間をより正確に評価できるようになると思いたくなります。

しかし今回のtokenmaxxingが示したのは、逆の可能性です。

測定能力が高くなればなるほど、「何を測るか」を間違えた時の副作用も大きくなる。

AI時代の人事評価で本当に必要なのは、

人間をより細かく測ることではありません。

おそらく、「測れるもの」と「本当に価値のあるもの」を区別する能力なのではないでしょうか。

そしてMeta自身が、AIをどれだけ使ったかではなく、AIを使っても使わなくても、最終的に何を生み出したのかへ評価軸を戻そうとしている。

もしそうなのであれば、Metaがtokenmaxxingから得た最大の教訓は、意外なほど昔ながらのものだったのかもしれません。

道具を使った回数ではなく、仕事を評価する。

AI時代になっても、人事評価の原則そのものは、それほど変わらないのではないでしょうか。

昨日書いた話題もMeta社の組織改革についての件です。

今回の件に興味がある方は、こちらも参考になるかと思います。

AIで社員を減らせば、本当に会社は強くなるのか?――MetaのAI組織改革が失敗した理由
AIで社員を減らせば、本当に会社は強くなるのか、Meta社の例を用いて考察してみました。

コメント

タイトルとURLをコピーしました