LLM– tag –
-
AI技術
[開発者向け]AIベンチマークの再現性を高めるには?評価者数と項目数の最適バランスをGoogle Researchが解説
はじめに Google Researchは2026年3月31日、機械学習モデルの評価における再現性向上のための研究成果を発表しました。本稿では、限られた評価予算のなかで評価者数(K)と評価項目数(N)をどう最適化するか、その手法と実践的な意味合いについて解説し... -
AI技術
[ニュース解説]LLMの行動傾向は人間とどこまで一致するか?Google Researchが25モデルを体系評価
はじめに Google Researchは2026年4月3日、大規模言語モデル(LLM)の行動傾向が人間の社会的判断とどの程度一致するかを測定する評価フレームワークを発表しました。本稿では、心理学の検証済み手法を応用した同フレームワークの設計と、25モデルに対す... -
AI技術
[開発者向け]Google Research「Titans + MIRAS」——AIに長期記憶を持たせるアーキテクチャ
はじめに Google Researchが2025年12月4日、AIモデルに長期記憶能力を与えるアーキテクチャ「Titans」と理論フレームワーク「MIRAS」について紹介しました。本稿では、この技術がどのようにRNNの速度とTransformerの精度を両立させ、200万トークンを超え... -
AI技術
[開発者向け]Googleが小型AIモデルでユーザー意図を高精度に理解する新手法を発表
はじめに Googleが2026年1月22日、小型マルチモーダルLLMを使ってモバイル端末やウェブブラウザ上のユーザー操作から意図を理解する新しい手法を発表しました。この手法は、自然言語処理分野の主要国際会議EMNLP 2025で発表された論文に基づくもので、大... -
AIツール
[AIツール利用者向け]「洗車場まで歩く?」——LLMが常識問題につまずく理由とは
はじめに IBM Thinkが2026年3月5日に報じた記事をもとに、ソーシャルメディアで話題になった「洗車テスト」を取り上げます。LLM(大規模言語モデル)が一見シンプルな問いに誤った回答を返す現象を、IBMの研究者たちの見解を交えながら解説します。 参考... -
AI技術
[開発者向け]LLMにベイズ推論を教える——「ベイズ教示」が切り開く適応型AIエージェントの可能性
はじめに Google ResearchのSjoerd van SteenkisteとTal Linzenらの研究チームが2025年1月7日にNature Communications誌で発表し、2026年3月4日にGoogleリサーチブログでも解説された研究を紹介します。LLM(大規模言語モデル)が確率的な信念更新を苦手... -
AI技術
[開発者向け]OpenAI Codex CLIのエージェントループを解剖する——プロンプト構築から推論、ツール呼び出しまで
はじめに OpenAIが2026年1月23日、ソフトウェアエージェント「Codex CLI」の内部動作を解説する技術記事「Unrolling the Codex agent loop」を公開しました。本稿では、エージェントループの基本構造、プロンプトの構築方法、パフォーマンス最適化の工夫... -
AI技術
[開発者向け]LLMには数学的な限界がある──エージェント型AIの可能性を問う研究
はじめに 大規模言語モデル(LLM)を基盤とするAIエージェントには、数学的に証明可能な限界が存在する──。こうした研究結果が、米国の技術メディアGizmoDoによって2026年1月23日に報じられました。本稿では、この報道をもとに、LLMの計算能力の限界と、エ... -
AI論文
[論文解説]LLMはどれくらい正確なのか?Google発のLLM新評価指標「FACTS」
はじめに 本稿では、Google DeepMindやGoogle Researchの研究チームが2025年12月11日に発表した、大規模言語モデル(LLM)の「事実性(Factuality)」を多角的に評価する新しいベンチマークスイート「FACTS Leaderboard」に関する論文について解説します... -
AI技術
[開発者向け]Google DeepMind「FACTS Benchmark Suite」発表——LLMの事実性を4つの観点から評価する新しいベンチマーク
はじめに Google DeepMindが2025年12月9日、大規模言語モデル(LLM)の事実性を体系的に評価するための「FACTS Benchmark Suite」をKaggleと共同で公開しました。本稿では、この発表内容をもとに、4つのベンチマークの詳細と評価結果、LLMの事実性におけ...