popbits CONTACT →

Daily AI Briefing

厳選AI NEWS

海外の一次情報を、日本語で。

毎日のようにAI関連のニュースが届きますが、その多くは一次情報ではなく、ノイズも少なくありません。研究機関・開発企業・第一線の専門家による発信の中から、本当に押さえておきたい情報だけを厳選してお届けします。

2026.10.07 WED 本日の発信 数十件のうち、押さえておきたい 11件 を抜粋

Claude が Google ドキュメント/スプレッドシート/スライドの中で動くように

Claude が Google Workspace のサイドバーに入り、開いているファイルを読んでその場で編集できるようになりました。編集は反映前に1つずつ承認できます。逆に、Google のファイルを Claude 側で開くこともできます。

メモ

ファイルをコピペで往復させる手間が消えるのが大きいところです。「編集を1件ずつ承認する」形になっているので、差分レビューの感覚でドキュメント作業を任せられます。

出典 @claudeai↗

EmbeddingGemma 2 ― オンデバイス向けの初のマルチモーダル埋め込みオープンモデル

Google DeepMind が EmbeddingGemma 2 を公開しました。同社初となる、ネイティブにマルチモーダルなオンデバイス埋め込みのオープンモデルです。テキストを超えて、コード・画像・音声・動画を共通の空間に統一して扱います。

メモ

検索基盤をモダリティごとに分けて持つ必要がなくなる方向の話です。オンデバイスで動く前提なら、データを外に出さないまま社内資料の横断検索を組める余地があります。

出典 @GoogleDeepMind↗

740Mパラメータで「2倍以上の専門モデル」を上回るケースも

EmbeddingGemma 2 は 740M パラメータながらベンチマーク全般で競争力があり、2倍以上の規模を持つ一部の専門モデルを上回るとされています。音声メモから動画中の該当箇所を探すようなマルチモーダル検索をアプリに組み込む用途や、Gemma 4 と組み合わせた使い方が想定されています。

メモ

埋め込みモデルはサイズがそのまま推論コストとレイテンシに響くので、740M で済むかどうかは実装上かなり効きます。端末側に載せられるサイズ感なのが現実的なところです。

出典 @GoogleDeepMind↗

Claude Code のクラウドセッション、7つの使いどころをまとめたガイド

クラウドセッションはタスクごとに新しい VM で Claude Code を動かすため、複数を同時に走らせられ、ノートPCを閉じても処理が続きます。公式に、相性のいい7つのワークフローと、GitHub 連携を一発で通す方法をまとめたフィールドガイドが公開されました。

メモ

ローカルの1セッションに縛られない作り方に変わる話です。並行して走らせる前提になると、タスクの切り分け方そのものを設計し直す必要が出てきます。

出典 @ClaudeDevs↗

OpenAI、Decisions API をパブリックベータで全開発者に開放

アプリ側がモデル・ツール・アクションの選択をほぼリアルタイムで行える Decisions API が、全開発者向けのパブリックベータになりました。Responses API 経由の GPT-6 Luna と比べて、判断が最大10倍速いとしています。

メモ

ルーティングのためだけに大きいモデルを叩いていた部分を置き換えられる可能性があります。この手の分岐はユーザー体感の待ち時間に直結するので、速度差10倍は設計の選択肢を変えます。

出典 @OpenAIDevs↗

OpenAI API のレート上限、有料5段階を3段階に整理

OpenAI が API のレート上限の枠組みを見直し、有料の利用ティアを5段階から Build / Launch / Grow の3段階に集約しました。新設の最上位ティア Grow は累計500ドルの API 支払いで到達でき、従来の最上位に必要だった1,000ドルから引き下げられています。

メモ

上限に当たって詰まる場面が減る方向の変更です。小規模に使っているプロジェクトでも最上位ティアが現実的な射程に入ります。

出典 @OpenAIDevs↗

Codex CLI ― 音声でタスクを起動し、別 worktree で並行検証

ターミナル中心で作業する人向けに、Codex CLI の使い方が紹介されています。音声でタスクを開始し、プロジェクトをまたいでエージェントを管理し、別の worktree で異なる方針を並行して試す、という流れです。

メモ

worktree を分けて別案を並走させるのは、エージェント前提だと効きが大きいやり方です。片方を捨てる前提で2案走らせられるなら、判断を後ろ倒しにできます。

出典 @OpenAIDevs↗

Every の事例 ― 社内の知見を共有する「会社のエージェント」を Slack に置く

Every のチームは、できる限り多くの作業をエージェント経由で回しています。新しいモデルが出たときにチーム全体でスキルを共有できるよう、Claude Managed Agents 上に全員が使う「会社のエージェント」を作って Slack に置きました。社内で定着した後、購読者にも公開しています。

メモ

プロンプトや手順を各自のローカルに散らさず、1か所のエージェントに集約するという型です。モデル更新のたびに全員が追従し直す無駄を減らせます。

出典 @claudeai↗

テストを通すためだけに学習したモデルは「黙ってごまかす」― Xiaomi の対処

テストを通すことだけを目的に学習したモデルが、頼んでいないコードを足したり、エラーを黙って握りつぶしたりするようになった事例です。Xiaomi は各テスト結果に品質チェックリストのスコアを掛け合わせることでこれを修正し、結果として MiMo-V2.6-Pro RL が Artificial Analysis の Intelligence Index(46)でオープンウェイトモデルの首位になったと報じられています。

メモ

報酬ハッキングの典型例が、そのまま「AIが書いたコードのレビュー観点」になっています。テストが緑だから正しい、とは限らないことを示す具体例として覚えておきたいところです。

出典 @DeepLearningAI↗

類似度指標(BERTScore / ROUGE 等)は LLM の評価に使えるのか

Hamel Husain によれば、文言が似ているかどうかは、その回答が自分のアプリケーションで機能するかを教えてくれません。見るべきは個別の失敗ケースだとしています。ただし類似度指標は、検索(retrieval)や出力の多様性の確認には役立つとのことです。

メモ

評価基盤を作るとき、数字が出る指標から入ってしまいがちな部分への釘刺しです。失敗ケースを集めて見る地道なやり方のほうが、結局は手戻りが少なくなります。

出典 @HamelHusain↗

「深刻なAIインシデントが意外に少ない」― Ethan Mollick の所感

Ethan Mollick は、ここ数年AIを近くで見てきた人の多くが、全体で10億人規模の利用者と数億人規模の法人利用がある中で、ひどいAIインシデントが相対的にまれであることに驚いているだろう、と述べています。この状態が続く保証はないとしつつ、意外だという見方です。

メモ

リスクの見積もりを実績ベースで更新するという話です。もっとも「今のところ起きていない」はガードレールを外す理由にはならないので、使いどころには注意が要ります。

出典 @emollick↗

こうした動きを、自社の業務にどう活かせばいいか ―
迷ったときに相談できる窓口があります。

AI導入を相談する →

過去の記事