OpenAI、リアルタイム音声の新アーキテクチャ「GPT-Live」を発表
OpenAIのGreg Brockman氏が、リアルタイム音声のための新しいアーキテクチャとスタック「GPT-Live」を紹介した。音声対話を専用の設計で扱う仕組みだという。
音声エージェントを作るならAPIの前提が変わる可能性がある。従来のRealtime API系との関係・レイテンシ・価格は要チェック。
CONTACT →
Daily AI Briefing
毎日のようにAI関連のニュースが届きますが、その多くは一次情報ではなく、ノイズも少なくありません。研究機関・開発企業・第一線の専門家による発信の中から、本当に押さえておきたい情報だけを厳選してお届けします。
OpenAIのGreg Brockman氏が、リアルタイム音声のための新しいアーキテクチャとスタック「GPT-Live」を紹介した。音声対話を専用の設計で扱う仕組みだという。
音声エージェントを作るならAPIの前提が変わる可能性がある。従来のRealtime API系との関係・レイテンシ・価格は要チェック。
Ethan Mollick氏が、Codex/コーディングエージェントの「ストレス解消になる意外な用途」として、手元のWindowsマシンの不調修理を挙げた。奇妙なドライバ問題、ゲームの非互換、スタートアップ登録したプログラムが起動しない、といった細かい不具合をエージェントに直させて何時間も節約できたという。
コーディングエージェントが「コードを書く道具」から「PCを触れる万能トラブルシューター」に広がっている例。OS操作権限を渡す使い方が普通になりつつある。
Mollick氏がCodexに「BlenderとUnityにアクセスできる。カワウソが動物型のメカスーツに乗り込むゲームを、アセットも含めてフルで作れ」と指示したところ、Codexが実際にPCを操作してゲームを作り上げたという。Webページ内の3jsデモとは一段違う例として紹介している。
ブラウザ内のデモではなく、Blender・Unityという実際のプロ用ツールをエージェントが横断して成果物を作る段階に来た。GUIアプリ操作の実用度を測る良いベンチマーク。
Hamel Husain氏が、コーディングエージェントのコミュニティの支持がClaudeからCodexに移ったと指摘。単なる印象論ではなく、ハーネス(Codex Desktop)の出来、サブスクリプションに含まれる範囲の広さ(fastモード等)や頻繁なリセットといった価格面を、Codex優位の要因として挙げている。
モデル単体の性能だけでなく「ハーネス+料金体系」が選定基準になっているという整理。ツール選びの評価軸として参考になる。
同じくHusain氏が、最先端モデルはコーディング能力が進歩した一方で、文章を書く能力はむしろ後退しているようだと指摘。いわゆる「slop(それらしいだけの量産文)」のレベルが目に見えて上がっているという。
コーディング向けの最適化が文章品質とトレードオフになっている可能性の指摘。文章生成の用途ではモデル選定を分ける根拠になり得る。
Mollick氏が、今から振り返るとAI初期のMicrosoftとGoogleは驚くほど大胆だったと指摘。MicrosoftはOpenAIより先にGPT-4を世に出し、Sydney騒動でも引かずCopilotを最初の業務用AIツールとして素早く市場投入、Googleも最初のDeep Researchを出しBardへ素早く舵を切ったと振り返っている。
市場が不透明な時期ほど大胆で、市場が明確になった今のほうが慎重という逆説。大手のAI製品戦略を読む上での一つの視点。
Nathan Lambert氏が、講座の締めくくりとしてQ&A動画を公開。能力ごとに別々に学習してからマージすべきか、RLVRでKLペナルティがしばしば省略されるのはなぜか、といったポストトレーニングのレシピ設計の細部に踏み込んだ質問に答えている。
ポストトレーニングの実務的な判断を体系立てて語れる人は少ない。RLVRのKL省略のような「現場の慣習」の背景を知れるのは貴重。
実世界タスクに向けた長期ホライズン(long-horizon)エージェントを前進させる論文「LongHorizon-Harness」がHugging Face Papersに公開された。
数分で終わるタスクから数時間・数日単位のタスクへ、というのがエージェント研究の現在の主戦場。ハーネス設計を扱う研究は実装にも直結しやすい。
Alpamayo 2 SuperがHugging Faceで公開された。ライセンスはLinux Foundationによるオープンモデル配布向けの寛容なライセンス「OpenMDW-1.1」で、ファインチューニング・派生モデル・商用再配布までカバーされ、自動運転の開発者や自動車・トラックメーカーが利用できるという。
モデル本体と同じくらい「OpenMDW-1.1」というライセンスの動きが重要。曖昧になりがちなオープンモデルの商用利用条件を標準化する試みとして押さえたい。
PyTorch公式が、Torch Inductorコンパイラとカーネル融合(kernel fusion)でメモリ帯域を改善し、カーネル起動オーバーヘッドを減らす方法の解説記事を公開。GPUの計算が速すぎて、高帯域なデバイスメモリですら追いつかないことがGPUコードの典型的なボトルネックだと説明している。
「GPUは計算律速ではなくメモリ律速」という前提を、torch.compile任せにせず仕組みから理解できる公式解説。推論・学習の高速化チューニングの基礎知識として。
こうした動きを、自社の業務にどう活かせばいいか ―
迷ったときに相談できる窓口があります。