AI利用と評価、先に押さえる結論
読了時間の目安
- しっかり読む
- 約13分
- 要点を読む
- 約6分
文字量と図表からの目安です。操作・実践の時間は含みません。
デューク大学の実験では、AI利用者が低く評価される場合がありましたが、本人の能力低下を示したわけではありません。職場では利用ルール・成果物の品質・人物への印象を分け、研究の条件を確かめて判断しましょう。デューク大学による研究解説
この記事では、2025年公表の研究を職場の判断へつなぎます。判断表で自分の場面を選び、次の確認事項を決められます。
こんな人におすすめ
- AIを仕事に使うと周囲の評価が下がるのか気になる人
- 部下や候補者のAI利用を、どう評価すればよいか迷う人
完成版更新:2026年9月30日
研究資料の最終確認:2026年9月30日
主な確認先はPNAS掲載論文の公開本文(PMC)、デューク大学の論文記録と研究解説です。本記事は公式一次情報をもとに構成しています。変わりやすい情報には確認日を付記しています。
公式事実と筆者の判断を分け、非推奨条件まで示します。研究は2025年公表のもので、読者の勤務先の現行ルールを確認した記事ではありません。
AI利用が気になるとき、何から確認する?
学べるブログの判断表は、AI利用をめぐる不安を社内ルール・成果物の品質・人物への印象に分け、研究で言える範囲と次の確認事項を整理します。迷ったら、利用ルール→成果物の誤り→人物への印象の順に確認します。
「次に確認すること」は筆者の判断基準です。確認先が異なるため3つに分けており、低評価を防ぐ効果を実証した手順ではありません。
| 自分の場面 | 研究から言えること | 研究だけでは言えないこと | 次に確認すること (筆者の判断基準) |
|---|---|---|---|
| 利用・開示のルールが分からない | 実験1では、職場で利用が許され、品質も確認した状況を設定した。 | 自社でも利用が許されるか、申告が必要か。 | 禁止されている用途は使わない。許可や入力範囲が不明なら、その作業への利用を保留し、規程の担当部署へ確認する。 |
| 成果物の誤りを指摘された | 実験2は人物の説明文に対する印象評価を測った。 | 自分の成果物の誤りの原因や、指摘が偏見によるものか。 | 誤りを確認できた箇所は修正する。品質基準が曖昧なら責任者へ確認し、人物への偏見かどうかの判断とは分ける。 |
| 怠け者・能力が低いと思われそう | 実験2では、AI利用者として記述された人物への評価が低くなる項目があった。 | 本人の能力低下や、特定の上司が同じ評価をするか。 | 具体的な指摘があるなら成果物と評価基準を照合する。まだ不安だけなら低評価を前提にせず、評価項目を確認する。 |
| 候補者や部下を評価する | 実験3では評価者の利用頻度、実験4では仕事内容により結果が異なった。 | AI利用者が一律に不適任か、デジタル業務なら常に有利か。 | 担当業務の基準を先に決める。AIの利用有無だけで採否を決めず、成果物と本人の確認責任を同じ基準で見る。 |
| 上司へAI利用をどう伝えるか迷う | 実験1は予想する評価と開示意向を扱った。 | 隠す利益や、特定の伝え方で評価が改善する効果。 | 開示義務があれば従う。不明なら担当部署へ確認し、説明する際は使用範囲・自分の判断・確認した内容を整理する。 |
研究部分の根拠:PNAS原論文の実験1〜4。右端の確認事項は、研究の結果を踏まえた筆者の提案です。
この表は、AI利用を隠すことや開示義務に反することを勧めるものではありません。また、実験4のメール業務で有意差がなかったことは「評価が同じ」との証明ではなく、説明の仕方で評価が改善するとの保証もありません。
選んだ行の未確認事項が、いま確かめる対象です。成果物そのものの誤りが気になる場合は、AI資料の数字・引用・共有範囲を提出前に確認するで、具体的な照合へ進めます。
研究はAI利用者の何を評価した?
デューク大学の研究は、AI利用者への評価を自己予測、他者による人物評価、候補者の適性評価や選択から調べており、本人の能力低下を測定した研究ではありません。社会的評価とは、ここでは他者からどう見られるかという評価を指します。PNAS原論文の研究概要
論文はJessica A. Reif、Richard P. Larrick、Jack B. Sollの共著です。公表時の所属は米国デューク大学Fuqua School of Businessで、4つの事前登録実験を報告しています。事前登録とは、研究の計画や分析方針を事前に登録することです。デューク大学の論文記録
| 実験 | 提示・想定したこと | 測った反応 | 混同しないこと |
|---|---|---|---|
| 1 | 仕事の報告書で生成AI、またはダッシュボード型の道具を使う状況。 | 周囲からの評価の予想、利用を明かす意向。 | 実際の上司の反応や、利用を隠した行動ではない。 |
| 2 | AIの助け、AI以外の助け、助けへの言及なしという人物説明。 | 怠けているか、能力があるかなどの人物への評定。 | 同じ完成品にAI利用ラベルだけを付けた比較ではない。 |
| 3 | 普段AIを毎日使う候補者と、使わない候補者などの情報。 | 課題への適性評定と、報酬にも関わる候補者の選択。 | 普段の利用頻度は、課題実行中のAI利用そのものではない。 |
| 4 | 生成AIまたは従来型ソフトの利用情報と、手書きのお礼・メールの仕事。 | 人物への怠惰の評定、仕事内容を示した後の適性評定など。 | 怠惰の評定は仕事内容を示す前。全評定が同じ順序・条件ではない。 |
出典:PNAS原論文の実験方法。人物への印象と、仕事に合うと判断したかは、分けて読む必要があります。
本人が予想した評価と、他者が付けた評価
実験1の「どう見られそうか」と、実験2の「他者をどう見たか」は別の測定です。実験1ではAI利用を想定した参加者が低い評価を予想し、利用を明かす意向も低くなりましたが、実際に隠したかは測っていません。大学解説の評価予測・開示意向
実験2では、AI利用者とされた人物が、能力や勤勉さなどの項目で低く評価されました。一方、野心や支配性の評定では有意差が確認されておらず、「やる気のすべてが低く見られた」と広げるのは不正確です。有意差とは、統計的な基準に照らして、偶然の変動だけでは説明しにくい差を指します。PNAS原論文の実験2の結果
また、「助けへの言及なし」は「誰の助けも使わなかったと確認済み」という意味ではありません。説明文から生まれた印象を扱うため、仕事の実力が低下したという読み方はできません。
採用を模した選択と、現実の人事評価
実験3は報酬のかかる候補者選択を含みますが、実在企業の採用率や昇進を調べた研究ではありません。管理者役の参加者は、タイルを数える課題に取り組む候補者を選び、その成績が自身の追加報酬に関わる仕組みでした。単なる印象質問を超えた選択ではあっても、継続的な雇用関係での判断とは条件が異なります。PNAS原論文の実験3の方法
AI利用者の評価はどの条件で変わった?
デューク大学の実験では、評価者自身のAI利用頻度や提示された仕事内容によって結果が異なり、AI利用者が一律に不利になるとは示されませんでした。ただし、条件による違いがあることと、その条件を変えれば評価を改善できることは別です。大学解説の評価者・仕事による違い
評価者自身のAI利用頻度との関係
実験3では、AIをあまり使わない評価者は非利用者を、よく使う評価者は日常的な利用者を好む傾向がありました。評価者全体をまとめた仕事への適性評定では、候補者のAI利用による有意差は確認されていません。PNAS原論文の実験3の結果
ここでの評価者の利用頻度は自己申告です。評価者を無作為に「AIを使う群」「使わない群」へ割り当てた介入ではないため、「上司にAIを使わせれば偏見がなくなる」とは言えません。筆者の判断基準としては、利用経験を決めつけるより、仕事のどの点が評価されたのかを確認する材料に留めます。
手書きのお礼とメール作成の違い
実験4では、手書きのお礼状の仕事で従来型ソフトの利用者がより適任と評価され、メール作成では単純比較の有意差が確認されませんでした。メールの条件には、AIが有用であり使用も許されるという説明が付いています。従来型ソフトはMicrosoft Officeなどを指し、何も道具を使わない人との比較ではありません。大学解説の手書き・メール条件
注意したいのは、怠けているかの評定が、仕事内容の説明より先に行われたことです。「AIに向く仕事だと伝えたら、怠け者という印象が消えた」と読むことはできません。メール条件で有意差がなかったことも、両者の評価が等しいとの証明ではありません。PNAS原論文の実験4の測定順・結果
論文には、怠惰の評定の影響を統計的に分けた分析で、AI利用者への正の直接効果も報告されています。しかし、それを単純比較で「AI利用者の方が高評価だった」と置き換えることはできません。仕事内容、比較相手、分析方法をそろえて読む必要があります。PNAS原論文の実験4の統計分析
研究結果を自分の職場へ当てはめてよい?
デューク大学の研究を職場の判断へ用いる場合、本記事では調査対象・参加人数・AIの扱いを、当てはめる範囲を確認する3つの観点とします。実験は2024年3月から2025年2月に行われました。PNAS原論文の実施時期・限界
日本の会社や今の職場にも当てはまる?
この研究だけでは、現在の日本の会社や自分の勤務先でも同じ評価が起きるとは判断できません。参加者はProlificやCloud Research Connectで集められたオンライン標本で、実際の組織での一般化には追加研究が必要です。勤務先では、評価基準や利用・開示ルールを別に確認してください。PNAS原論文の標本・一般化の限界
4,439人は同じ実験の分析人数?
抄録の4,439人は4つの実験を合わせた記載であり、全員が同じ課題を受けた一つの分析の人数ではありません。除外後の分析人数は実験ごとに異なるため、「4,439人全員がAI利用者を低く評価した」とは書けません。大学の論文記録にある抄録
実験3の最終人数は、方法節に1,668人、図3の注記に1,667人という表記差があります。差の理由は確認できていないため、本記事ではどちらかを確定値として採用しません。PNAS原論文の方法節・図3(2026年9月30日確認)。
ChatGPTなど特定製品の評価なの?
この研究は、ChatGPTなど特定製品やモデルの性能を比較して、仕事に最適なサービスを決めるものではありません。主題はAIの利用情報が人物評価にどう関わるかであり、製品別の精度や現在の料金・機能は調査対象と分けて考えます。PNAS原論文の研究対象
まとめ|次に何を確かめる?
学べるブログは、AI利用への不安に対して、判断表から自分に関わる未確認事項を一つ選び、社内ルールや評価基準の確認先を決めることを提案します。研究は低評価が起こる場合を示しましたが、自分の能力低下や勤務先での不利益を決めるものではありません。
次の行動は、選んだ確認事項を、確認できる相手・資料へ一つつなぐことです。利用・開示なら規程や担当部署、品質なら成果物と責任者、人物への印象なら具体的な評価基準を示せる上司が候補になります。ここでの提案は筆者の判断であり、話し方による評価改善を実証したものではありません。
研究者は、AIが人の固有の技能を補う使い方の説明なども提案していますが、改善策としての効果をこの実験で検証したわけではありません。研究結果を根拠に開示義務を省いたり、特定の伝え方で評価が上がると期待したりすることは勧めません。大学解説にある研究者の提案
担当業務や職場のAI利用・開示・評価ルールが変わったときは、判断表で自分の確認事項を選び直してください。
引用元・参考情報
- PNAS:AI利用者への社会的評価を扱う原論文
Evidence of a social evaluation penalty for using AI。実験方法・結果・限界・人数表記。原論文の公開本文(PMC)も参照できます。最終確認:2026-09-30。 - デューク大学:原論文の書誌情報・抄録
著者、4つの事前登録実験、抄録の参加人数。最終確認:2026-09-30。 - デューク大学Fuqua:AI利用と職業上の印象の研究解説
評価予測、評価者と仕事内容の条件、研究者の提案。最終確認:2026-09-30。
コメント