Verbalized Samplingの使い方|日本語例と確率の意味

AI研究・論文解説
ページの位置未計測

AIの使い方・研究を読む

似通う案を広げ、
確率に採否を任せない。

読了時間の目安

しっかり読む
約13分
要点を読む
約8分

文字量と図表からの目安です。操作・実践、X投稿や動画の閲覧時間は含みません。

Verbalized Samplingは、AIの案が似通うときに、複数案と各案の推定確率を求めて発想を広げるためのプロンプト手法です。確率で良し悪しを決めず、候補を目的と制約で選ぶ使い分けを、本記事では提案します。著者による手法の説明

Verbalized Sampling(以下VS)とは、候補の本文と、その応答が生じる推定確率をまとめて出すよう依頼する方法です。追加学習を必要とせず、独立した新モデルやチャットサービスではありません。公式の基本テンプレート

この記事では、通常の複数案との使い分け、日本語の依頼文、確率の読み方、候補を残す基準まで扱います。日本語の依頼文は筆者の応用例であり、日本語の企画でも研究と同じ効果が出ると確認したものではありません。

こんな場面で役立ちます

  • 記事の切り口や企画を頼んでも、似た案が続く。
  • 「複数案と確率を出して」という指示の使いどころを知りたい。
  • 確率の高い案・低い案のどちらを選ぶべきか迷っている。

公式情報の最終確認: / 参照:論文v4

自分の目的には、どの頼み方を選ぶ?

Verbalized Samplingは、案が似通って発想を広げたい場合の選択肢であり、本記事では、方向性が決まった修正や事実確認と分けて使うことを提案します。研究でも、直接回答、複数候補の列挙、候補と確率を出すVSは区別されています。論文v4の手法比較

下の表は筆者の判断基準です。候補を広げる作業と、表現を直す作業、根拠を確かめる作業では、必要な出力が違うためです。

表が収まらない場合は、左右にスクロールできます。

AIのアイデア出し:頼み方と次の行動
対象:候補を作る・直す・選ぶ場面。筆者の判断基準/根拠確認:2026年9月25日
いまの目的選ぶ頼み方出力で確認する点避ける読み方次の行動
方向性が未定で、まず候補が欲しい目的と制約を付けた複数案の列挙切り口に違いがあるか候補数が多いだけで多様だと決めない似通う場合はVSを検討
案が似通い、別の切り口を探したい候補と推定確率を求めるVS内容の違いと制約への適合低確率ほど良案だと決めない目的と制約で候補を残す
方向性が決まり、表現を整えたい変更点を限定した通常の依頼指定した修正が反映されたか毎回VSが必要だと思わない修正案を比較する
正確な事実や根拠を確かめたい一次資料の確認を中心に進める主張・出典・条件が対応するか表示確率を正解率と見なさない根拠が足りなければ採用保留
最終案を採用したい目的・制約・根拠に照らした評価採用理由を具体的に説明できるか最大・最小の確率だけで選ばない条件を満たす案を次工程へ

判断の根拠:候補と確率を求める基本形、論文v4の制限事項。

表示確率は応答の推定値で、正解率・企画の成功率や、モデル内部の確率をそのまま読み出した値ではありません。日本語の企画で同じ効果量が得られるかも未確認です。低い数値を探すより、内容の違いと制約への適合を先に見ます。

日本語でVerbalized Samplingをどう頼む?

Verbalized Samplingは、課題に対する複数の候補と各候補の推定確率を求める手法で、日本語の依頼文は本記事による応用例として示します。まずは確率に上限を付けず、目的と制約を伝える基本形から始める、というのが本記事の提案です。公式の入力・出力形式

目的・読者・制約を依頼文へ入れる

題材だけでなく、誰に何を届けたいかと、守る条件を書きます。たとえば「読書の記事案」なら、対象を読書が続かない社会人、目的を読み始めるきっかけ作り、制約を高額な道具の購入を勧めないこと、と具体化できます。入力の基本を見直す場合は、目的・前提・出力形式の整え方も参考になります。

公式GitHubでは、依頼文をチャットへ入力して使う経路が案内されています(2026年9月25日確認)。この記事ではチャットへの入力を扱い、APIの導入手順は扱いません。公式の利用案内

利用するサービスの料金・回数制限・提供地域・入力データの扱いは、本記事の調査対象外です。VSという頼み方だけを根拠に、無料・無制限・機密情報を入力可能とは判断しないでください。

基本形の日本語プロンプトを使う

次の依頼文の[ ]を自分の条件へ置き換えて使います。公式の基本形を参考にした筆者の日本語応用例であり、公式訳や効果を実測したテンプレートではありません。候補数の5は設定例で、最適値という意味ではありません。応用の基にした実験用テンプレート

条件を差し替えて使う依頼文

次の条件に合う案を5つ作成してください。

題材:[考えたいテーマ]
読者・対象者:[誰に向けた案か]
目的:[案によって実現したいこと]
制約:[守る条件・避けたい内容]

各候補について、次の2項目を出してください。
・text:案の本文
・probability:この入力に対して、その応答が生じると推定する確率(0〜1)

確率は、表示する5候補だけを母集団にせず、考えられる応答全体に対する推定値として示してください。企画の成功率・正解率・好みの点数には置き換えないでください。
この定義の推定値を出せない場合は、その旨を明記してください。

出力されたら、5候補それぞれに本文と数値が対応しているかを確かめます。そのうえで、言い換えだけの案が並んでいないか、入力した制約を守っているかを見ます。数値が出たことだけを成功の判定にしません。

低確率の指定は必要なときだけ追加する

低確率側を狙う指定は、基本形とは分けて考えます。公式Quickstartには、5候補を出し、各候補の確率を0.10未満にする例があります(2026年9月25日確認)。この値は掲載例であり、全用途の必須条件や日本語での最適値ではありません。公式Quickstartの追加条件

本記事では、基本形でも候補の違いが小さく、さらに珍しい応答を探したい場合に限って検討することを提案します。論文は極端な低確率指定の制限も扱っているため、数値を下げ続けることを目的にせず、内容が崩れたら条件を戻します。論文v4・付録F.6

表示された「確率」をどう読めばよい?

Verbalized Samplingの基本形で出す確率は、入力に対してその応答が生じる推定値であり、企画の成功率や回答の正解率を表す数値ではありません。何の確率を求めたのかを先に確認し、その定義に沿って読みます。公式基本形の確率の定義

応答の推定値を、正解率や成功率から分ける

表示確率は、その案が正しいか、読者に受けるかを採点したものではありません。「0.08」と表示されても、企画が8%の確率で成功する、あるいは92%間違っているという意味にはなりません。

また、モデル内部の値を直接取り出した結果とも区別します。論文には、限られた回答空間で推定値と分布の対応を調べる評価がありますが、全用途で完全に一致する根拠にはできません(参照:v4、2026年9月25日確認)。論文v4・付録E.10の評価

「confidence」という単語を使えば無効になる、という理解も避けます。論文ではこの名前の変種も比較しており、応答全体に対する代表性を表すスコアとして定義されています。単語の選択だけでなく、数値の対象と定義が重要です。論文v4・付録F.4の定義比較

候補の合計100%を一律に求めない理由

考えられる応答全体に対する推定値を出す形式では、表示候補だけで全体を尽くすとは限りません。5候補の中から選ぶための重みに変換することと、応答全体に対する推定値を求めることは別です。全体に対する推定値を求める基本形

表示候補は応答全体の一部です。pは推定値を表します。ファイルは概念上の比喩で、枚数・面積は確率を表しません。

公式Quickstartの条件どおり、5候補の値がそれぞれ0.10未満なら、合計は0.50未満(5×0.10=0.50)です。この条件と「合計を1にする」という要求は両立しません。これは掲載条件から導ける計算であり、実際の出力を測った結果ではありません。計算の前提となる公式例(2026年9月25日確認)

合計が100%にならないことだけで不具合とは決めず、どの範囲に対する数値を依頼したかへ戻ります。ただし、この説明は、定義が不明な数値や条件に反した出力をそのまま信用してよいという意味ではありません。

研究の「多様性1.6〜2.1倍」はどこまで参考になる?

Verbalized Samplingの著者は、詩・物語・ジョークの実験で直接回答より多様性が1.6〜2.1倍になったと報告しており、日本語の企画成果を保証した結果ではありません。この倍率は、何を比較し、何を測ったかとセットで読みます。著者による結果の要約

共著者のX投稿:「ひと言で創造性2倍」という紹介の原文

著者の公式ページが案内する、共著者Weiyan Shi氏のの投稿です。

日本語訳(抜粋):ひと言で、ChatGPTの創造性を2倍にできる。

投稿の要約:AIの回答が似通う問題を取り上げ、より多様な応答を引き出す研究と、コピーして使えるプロンプトをスレッドで紹介しています。

倍率の読み方:「2倍」は投稿での研究紹介の表現です。本記事では、創作タスクの多様性が1.6〜2.1倍になったという報告を、比較条件と制限を含めて読みます。日本語の企画の成功率や、現在のChatGPT全般の性能が2倍になるという意味ではありません。

投稿は本記事の参照版である論文v4(2026年7月15日改訂)より前のものです。以下の実験条件はv4と公式実験ガイドに基づきます。Weiyan Shi氏のX投稿を読む / 著者のプロジェクトページ

3大学の研究と、直接回答との比較条件

研究の著者は、Northeastern University、Stanford University、West Virginia Universityに所属する7人です。Stanford単独のサービス発表ではありません。公式ページの著者・所属

論文の初版は2025年10月1日、本記事の参照版は2026年7月15日改訂のv4です。ここでは参照版を固定し、旧版から何が改善されたかという比較は行っていません。論文の提出・改訂履歴(2026年9月25日確認)

創作実験は各タスク100題、各題30応答、複数候補をまとめて出す設定では1回5候補という条件です。直接回答だけでなく、確率を付けずに候補を並べる方法などとも比較しています。自分の依頼で一度5案を出すだけでは、この評価条件の再現にはなりません。公式実験ガイドの条件

多様性の評価には、文章を意味の特徴を表す数値へ変換し、応答同士の似通い方を比べる方法が使われています。1.6〜2.1倍は案の数や売上の倍率ではなく、著者が創作タスクの多様性についてまとめた値です。論文v4・第5節と付録G.1

日本語への応用と品質について残る制限

日本語のブログ企画で同じ改善幅が出るかは、本記事が確認した資料では明記されていません。研究で評価したモデル群も、現在チャット画面で選べるモデルの一覧や推奨順位としては使えません。論文v4の対象と評価条件(2026年9月25日確認)

推測:日本語でも、いつもの切り口から離れる候補を探す補助にはなると考えられます。ただし、それは本記事の応用上の見立てで、効果量を確認した結果ではありません。

論文では、モデルの能力、候補増加に伴う負荷、極端な低確率指定による制限も述べられています。多様な案が出ることと、その案が条件に合い正確であることは分けて確認します。品質が全条件で維持されるとは扱いません。論文v4・付録BとF.6(2026年9月25日確認)

まとめ:出た候補を採用してよいか?

Verbalized Samplingで得た候補は、表示確率だけで採否を決めず、目的への適合・制約・事実の根拠を確認して選ぶ、という基準を本記事では提案します。候補を出した後は、次の3つの状態で進め方を分けます。

制約を外れた案は再依頼へ戻す

読者や予算などの条件を外れた案は、違反した条件を具体的に伝えて出し直します。たとえば「道具の購入を勧めない」という条件に反する案なら、確率を下げるより、その条件を守って別案を出すよう頼むほうが、修正の目的を明確にできます。

事実の根拠が足りない案は保留する

数字・研究結果・製品仕様を前提にした案は、その根拠を確かめるまで採用を保留します。「この方法で売上が伸びる」という提案に数値が添えられても、VSの表示確率はその主張の裏付けにはなりません。事実として使う部分は、対応する一次資料へ戻って確認します。

目的に合う案を次の工程へ進める

目的と制約を満たし、必要な根拠を確認できた案は、構成作りや下書きへ進めます。採用理由を「数値が低かったから」ではなく、「対象読者のこの困りごとに答え、指定の条件も守れるから」と説明できるかが、本記事の判断基準です。

今することは、自分の作業を冒頭の判断表の1行に当てはめることです。案が似通っているなら、目的と制約を入れた依頼文から始めてください。

別の企画で使うときは用途別判断表を見直し、論文の結論・制限や公式プロンプトに変更が確認されたときは、確率の説明と依頼文の条件を再確認してください。

引用元・参考情報

ブログをメールで購読

学べるブログの更新・重要アップデート(Grok/Gemini など)を、メールで受け取れます。無料。いつでも解除できます。更新時(週1〜2回目安)

AI研究・論文解説

コメント

学べるブログをもっと見る

今すぐ購読し、続きを読んで、すべてのアーカイブにアクセスしましょう。

続きを読む

学べるブログをもっと見る

今すぐ購読し、続きを読んで、すべてのアーカイブにアクセスしましょう。

続きを読む