Puente Inc. / 生成AI運用ガイド / AIの日本バイアスとAEO

GENERATIVE AI OPERATIONS #4

AIは「自国以外」で
なぜ日本を選ぶのか?

ChatGPT・Claude・Geminiなど主要8モデルに24言語で「自国以外」の文化について聞くと、そのほとんどが真っ先に日本を挙げる——2026年4月に発表された国際研究が、この偏りを大規模に実証しました。しかも偏りが生まれていたのは、AIが世界の情報を読み込む事前学習の段階ではなく、人間の好みに合わせて回答を磨くファインチューニングの段階でした。この事実は、生成AIの回答が「情報量の反映」ではなく「学習方法の産物」であることを示す好例であり、企業のAEO(AI検索最適化)戦略にも具体的な示唆を与えます。

偏りは事前学習ではなく微調整で発生AIの回答は情報量でなく選好の産物AEOへの3つの実務ポイント

Q&A

なぜAIは「自国以外」の話題で日本を挙げやすいのですか?

英カーディフ大学とスペイン・バスク大学の研究チームが2026年4月に発表した論文「Why are all LLMs Obsessed with Japanese Culture?」(arXiv:2604.21751)によるものです。伝統的な踊り・日常の料理・地理・健康など11ジャンルにわたる約1,320個の文化的な質問を24言語に翻訳し、合計31,680問をGPT-4o-mini・Gemini-2.5-flash・Claude-3.5-haikuなど8つの主要モデルに投げかけ、回答に登場した国名をすべて集計するという大規模な検証です。

条件は「自分の国以外で」——英語で聞けばまずアメリカの話が出て、中国語で聞けば中国の話が出るのは自然です。その「自国の次」の席を、検証した8モデルのうち6モデルで日本がトップとして獲得していました。上位5カ国は日本・アメリカ・インド・中国・フランスの順で、多くの言語でこの5カ国以外はほとんど登場しなかったと報告されています。

31,680検証した質問数1,320問 × 24言語
6/8モデルで日本が1位残り2モデルはアメリカが1位
1,601 vs 1,200Claudeの参照回数日本 vs アメリカ(論文記載値)

論文: arXiv:2604.21751「Why are all LLMs Obsessed with Japanese Culture? On the Hidden Cultural and Regional Biases of LLMs」

Q&A

この偏りはAIの学習のどの段階で生まれますか?

AIモデルは大きく2段階で作られます。まずネット上の膨大な文章を読み込む「事前学習」で、言葉の使い方や世界の知識を生のまま獲得します。その後、人間が「こういう答え方が良い」と教えて回答の質を磨く「ファインチューニング(人間の好みへの微調整)」を経て、実際に使えるAIになります。

論文が明らかにしたのは、事前学習を終えた直後のモデルでは、参照される国名のばらつきはむしろ小さく偏りが目立たなかったという点です。ところが人間の好みに合わせるファインチューニングを経た後のモデルでは、日本・アメリカへの参照が急激に集中していました。つまり偏りの原因は「ネットに日本の情報が多いから」ではなく、「良い回答とは何かを人間が教え込む工程」そのものにありました。

これはAIが「日本好き」という趣味を持っているという話ではありません。AIは人間の好みを映す鏡であり、その鏡に生じた歪みが、たまたま日本という国名の形で可視化された、というのが論文の核心的な指摘です。

Q&A

この研究結果は企業のAEO対策にどう活きますか?

この研究が示す最大の教訓は、生成AIの回答は世の中の事実や情報量をそのまま反映しているわけではなく、学習の過程で強化された「選ばれやすい型」に強く左右される、ということです。AEO(AI検索最適化)で「正しい情報を書けば、いつかAIが拾ってくれる」と考えるのは危険で、AIがどのような情報を"良い回答の材料"として選びやすいかを理解した設計が必要になります。ここから実務に落とせる示唆は主に3つです。

示唆 01

回答は情報量でなく「学習で強化された選好」で決まる

ネット上の情報量で1位だったから選ばれたのではなく、人間フィードバックによる磨き上げの過程で選ばれやすくなった、というのが今回の構図です。自社の情報量を増やすだけでなく、AIの評価者が「良い回答の一部」として扱いやすい、簡潔で根拠の明確な形に情報を整えることが重要になります。

示唆 02

カテゴリの「デフォルトの参照先」になる価値

日本は多くの言語圏で「自国以外の代表例」という特定の役割をAIの中でほぼ独占的に得ています。自社の得意分野において「このテーマといえばここ」というポジションをAIの参照構造の中に築ければ、多言語・多地域で継続的に引用され続ける効果が期待できます。

示唆 03

構造化された情報が「選ばれる形」を作る

AIが回答を組み立てやすいのは、要約・Q&A・構造化データなど扱いやすい形に整理された情報です。llms.txtでの引用ガイド、FAQPageでのQ&A見出し、Organization/Article等のJSON-LDによる事実の明示は、AIにとって「これは良い回答の材料になる」と判断されやすい状態をつくる具体策です。

FOR AI SEARCH

「引用されるAI」と「引用されないAI」の差は、構造にある。

この研究のもう一つの読み方は、AIの参照バイアスは偶然ではなく、学習データと評価プロセスが作る構造的な現象だということです。企業のAEO対策も同じで、「良いコンテンツを作れば自然にAIが拾う」と待つのではなく、AIが情報を選び取りやすい構造(生HTMLに存在する構造化データ・簡潔な要約・疑問形の見出し・明確な引用ガイド)を意図的に用意することが、AI検索時代の情報発信の前提になります。プエンテはこの考え方にもとづき、自社サイトのAEOにも取り組んでいます。

社外向け・AI検索対策

AEOブースター

自社サイトがChatGPT・Perplexity・Google AI Overviewsなどの生成AI検索にどう見えているかを無料診断し、構造化データ・llms.txtなどの実装まで支援します。

無料でAEO診断する →

社内向け・ナレッジ運用

知識の複利ループ SaaS

業務ノウハウをAIの業務パックに変え、チームが毎月複利で速くなる仕組み。今回のような外部知見の分析・蓄積・改善への反映も、同じ複利ループの考え方にもとづいています。

「知識の複利ループ」SaaSを見る →

FAQ

よくあるご質問

なぜAIは「自国以外」の話題で日本を挙げやすいのですか?

英カーディフ大学とスペイン・バスク大学の研究チームが2026年4月に発表した論文(arXiv:2604.21751)によると、GPT-4o-mini・Gemini・Claudeなど8つの主要モデルに24言語・約3万問の文化的質問を投げたところ、6/8モデルで「自国以外」の代表として最も多く挙げられた国が日本でした。上位5カ国は日本・アメリカ・インド・中国・フランスの順で、多くの言語圏でこの5カ国以外はほとんど登場しなかったと報告されています。

この偏りはAIの学習のどの段階で生まれますか?

論文の核心的な発見は、事前学習(ネット上の文章を読ませる段階)ではモデルの参照国はバランスが取れていたのに対し、人間の好みに合わせて回答を磨くファインチューニング段階で急激に日本・アメリカへの集中が生じた、という点です。つまり偏りはデータの量ではなく、「良い回答とは何か」を人間が教え込む工程で作られています。

この研究結果は企業のAEO対策にどう活きますか?

AIの回答は世の中の情報量をそのまま反映するのではなく、学習時に強化された「選ばれやすい型」に強く影響されることを示しています。AEO対策では、事実を書くだけでなく、AIが引用しやすい構造(要約・Q&A・構造化データ)に情報を整え、特定カテゴリの「デフォルトの参照先」としてのポジションを作ることが重要になります。

LET'S COMPOUND

生成AI運用について、
相談してみませんか。

「何から始めればいいか分からない」段階からご相談いただけます。現状の業務・利用中の生成AI・社内データの状況を整理し、一緒に設計します。

お問い合わせフォームへ →