
1010 | AIエージェントが日常に浸透する週
Show notes
今週のAI製品ニュースを総ざらい。個性を持つAIエージェント、オープンソースの代替ツール、映像と創作系AI、モバイル生活を変えるアプリ、ビジネス向けインフラまで、注目のローンチをコンパクトに紹介します。
タイムライン
- 00:00:04 オープニング
- 00:00:43 固有アイデンティティを持つAIエージェントとその実行環境
- 00:04:37 デスクトップとノッチ、コーディングエージェントの扉
- 00:06:57 マーケティングとSNS運用のオープンソース化
- 00:09:39 世界モデルと創作AI: 映像・会議・ゲーム
- 00:12:19 モバイルと日常端末のAI化
- 00:14:28 学習とコンプライアンスの実務ツール
- 00:15:51 音声から記憶へ: 個人のメモ
- 00:17:33 クロージング
関連リンク
- Ambiguous Workspace
- Gemini Agent for Google Cloud
- Melete
- AgentSDR
- OpenPilot
- Murmur
- Thravik
- Pine Computer
- Busabase
- OpenCharm
- Together Link
- Opposable
- BrightBean Studio
- Zernio
- Comcent
- Odyssey 3
- HeyPi
- Playground by Google Labs
- Refs
- OpenVids
- Amazon Alexa Tablets
- Phonable
- Rune
- Staffcoder
- Regunow
このエピソードは Bri によって制作されています。Bri は高度な AI 技術で、あなたが気にかけるフィードを聞くためのポッドキャストに変換します。お問い合わせは hi@bri.so まで。
Transcript
葵: こんばんは、葵です。
悠真: 悠真です。今日もAIプロダクトの新着情報を、一日分まとめてブラッシュアップでお届けしていきます。
葵: 今日のラインナップを見ていて一番印象的だったのは、AIエージェントが少しずつ「人格」と「環境」を持ち始めていることなんですよね。ログインではなく固有のアイデンティティを持つエージェント、専用のコンピュータ、独自のメールアドレス。この流れが今日の全体を貫いていて。
悠真: そうですね。で、そのエージェントを動かす側の話、つまり自分のAPIキーとオープンソースで自前運用する流れも別の話題で出てくる。頭と手を自分で用意する、という構図です。
葵: では早速、最初のテーマから。まずAmbiguous Workspaceというプロダクトから。18のKIネイティブ、つまりAIネイティブな生産性アプリをまとめて提供していて、5人までの利用なら無料という設定です。
悠真: 5人まで無料というのは小さいチーム向けのエントリーモデルとしてよくある形ですが、ここで注目すべきは課金や料金の仕組みではなく、エージェントの扱い方なんです。このワークスペースでは、AIエージェントがログイン情報を借りるのではなく、固有のアイデンティティを持つ、と説明されています。
葵: これは結構大きな違いですよね。今までのAIツールって、要は自分のアカウントでAIに操作させていた。でも固有のアイデンティティを持つということは、AIが「誰か」としてワークスペースに存在するわけです。
悠真: そうなると、誰が何をしたかの履歴や権限の考え方が変わってきます。ユーザーとは別の主体としてエージェントがいる、という世界観です。
葵: で、その延長線上にあるのがGemini Agent for Google Cloudです。こちらはGoogle Cloud向けの汎用エージェントで、自律的に計画を立てて、Workspace、M365、MCPを操作できる、と。しかも「AI同僚」という説明で、独自のメールアドレスを持つとされています。
悠真: AI同僚にメールアドレス、というのはわかりやすい喩えですが、裏を返せばエージェントが組織の一員のように振る舞う前提の設計なんですね。WorkspaceもMicrosoft 365も操作対象に入っているのが特徴で、特定のエコシステムに閉じない汎用性を謳っている。
葵: ただ、ここは慎重に見るべきところで、「自律的に計画する」という部分はメーカーの説明であり、実運用でどこまで安全に、どこまで正確に動くのかはまだ未知数です。このトピック全体に言えることですが、安全性と価格がまだ見えていない。
悠真: ええ。次のMeleteは、その点さらに先を行っていて、個人向けのAIエージェントに「専用のコンピュータ」と「永続的な記憶」を与える、というプロダクトです。しかもモデルは交換可能と来ている。
葵: 専用コンピュータというのが面白くて、つまりエージェントの居場所がクラウドのどこかではなく、一つのマシンとして確保されている。記憶も永続的で、会話が終わっても続く、と。今はクラウド版の待機リストが開いている段階です。
悠真: 永続記憶というのは、この日の流れの中で何度か出てくるキーワードです。後半で出てくるメモ系のアプリともつながる話なので、ここで押さえておいてください。
葵: そしてPine Computer。これはAIのためのクラウドコンピュータです。特徴として、画面のピクセルを読むのではなく、アプリの構造を読む、という説明があります。それによって2〜5倍速く、コストは25分の1、と主張されています。
悠真: ピクセルではなく構造、というのは、従来の「AIが画面を見て操作する」方式と対比した話ですね。画面を画像認識で読むのは遅いし誤読もある。アプリの内部構造に直接アクセスできれば速くて安い、という主張です。今は招待制のベータなので、この速度とコストの数字は確認できる段階にはありません。
葵: ここで一句、エージェントが動くための場所について整理してみましょうか。アイデンティティはGemini AgentやAmbiguous Workspaceが担い、記憶はMelete、実行環境はPine Computer、そしてデータの置き場所は、Busabaseです。
悠真: Busabaseはオープンソースのデータベース兼ワークスペースで、エージェント向けの共有データストアを持つ、というものです。ポイントは、アクセスと変更の監査がついていること。
葵: 監査がついているのは理にかなっていますよね。複数のエージェントが同じデータを読み書きする世界になると、誰が、いつ、何を変えたのかを追跡できないと運用が破綻する。オープンソースなので自前で立てられる点も、これから話す流れとつながります。
悠真: そう、ここからが二つ目のテーマです。エージェントの頭、顔、手が揃いつつある、という話。まず頭から。OpenPilotはMITライセンスの無料デスクトップAIエージェントです。
葵: MITライセンスなので完全に自由に使えて、OpenAI互換のAPIを通じて自分の好きなモデルを使えます。ファイルの読み書きができるとされ、macOS対応は近日とのこと。
悠真: 自分のモデル、自分のキー、というのがここでも繰り返される。クラウドの巨人が「AI同僚」を提供する一方で、個人や小さなチームはオープンソースと自前のモデルで同じことをやろうとしている。この対比が面白い。
葵: 次が顔です。OpenCharm。これはMacのノッチ、つまり画面上部の切り欠き部分に、顔と声を持つAIコンパニオンを置くプロダクトです。
悠真: ノッチに顔を表示するのは発想が面白いですね。しかもエージェントの状態を表示して、キー操作で制御できる、と。裏で動いているエージェントに「顔」があって、今どういう状態かわかる、というUIの発想です。
葵: エージェントが増えてくると、裏で何をしているかわからない不安が出てくる。それを可視化する場所としてノッチを使うのは、Macという限られた画面スペースの活用として理にかなっています。
悠真: そして手。Together Linkは、Claude CodeやCodexといったコーディングエージェントを、Together AIのオープンモデルに接続してコストを下げる、というもの。無料で使えます。
葵: コーディングエージェントを動かすには通常、高価なモデルを使うことになる。オープンモデルに差し替えられるなら、同じ作業を安くできる可能性がある。ただ、どのタスクでどのオープンモデルが実用に耐えるかは、使ってみないとわからない部分です。
悠真: 最後がOpposable。これはClaude CodeやCodexに、本物のiPhoneやAndroid端末を実際に操作させる、というものです。
葵: 実機に触らせる、というのは大胆ですね。エミュレータではなく実デバイスに「エージェントの手」が伸びる。そして大事な設計として、支払いはユーザーの承認待ちになる、と。
悠真: そこは安全弁としてかなり慎重な設計ですよね。エージェントが自由にお金を動かせないようになっている。ファイルを読み書きするエージェント、コーディングするエージェント、スマホを操作するエージェント。頭、顔、手、と揃ってきました、というのがこのセクションのまとめです。
葵: さて、ここからはマーケティングとSNS運用のオープンソース化、という流れに入ります。先ほどの「自分のキーとオープンソース」という話と、そのままつながりますね。
悠真: まずBrightBean Studio。これはオープンソースのBufferの代替で、AGPLライセンスです。10以上のプラットフォームへのスケジュール投稿ができて、MCPサーバーも持っている。
葵: MCPサーバーを持っている、というのがポイントです。つまりエージェントからこのツールを操作できる。人間がダッシュボードで投稿を予約するだけでなく、AIエージェントがSNS運用の一部を担える設計になっている。
悠真: そして「席単位の課金がない」という点。既存のSaaSは席数で課金するものが多いですが、オープンソースで自ホストならその縛りから解放されます。
葵: 次のAgentDRは、さらにその方向を推し進めたものです。オープンソースのAI-SDR、つまり営業のアウトバウンドを担うエージェントで、Clay、Smartlead、HubSpotを置き換える、と説明されています。
悠真: 一つのツールでメール、LinkedIn、WhatsAppを扱えて、自分でホストして自分のAIキーで動かす、という。Clay、Smartlead、HubSpotを「置き換える」という言い方はかなり大胆ですが、具体的な移行の容易さや実運用での安定性はまだ検証が必要な主張です。
葵: ええ。SDRの自動化は効果が出やすい分野である一方、送信品質やアカウント制限などのリスクもある領域なので、ここは慎重に見たいところです。
悠真: Zernioは少し立場が違っていて、インフラ側のプロダクトです。16のソーシャルプラットフォーム、広告、WhatsApp、iMessage、電話を一つのAPIにまとめた、と。
葵: さらにMCPでエージェントから利用可能、と。つまりエージェントがマーケティングの通信全般をAPI経由で触れる、という世界です。先ほどのBrightBeanやAgentDRが「ツールの代替」だとすれば、Zernioは「その土台を提供する」位置づけですね。
悠真: そしてComcent。これは自社のSIPトランク上に音声インフラを置くもので、AI文字起こしと要約、vCon形式での出力ができる。料金は月20ドルで無制限ユーザー、AGPLライセンスのオープンソースです。
葵: vConというのは音声会話の記録を標準化した形式で、コンプライアンスや分析の用途に向いています。月20ドルでユーザー数無制限という価格設定は、既存の通話・文字起こし系SaaSの席課金とは真逆を行っている。
悠真: このセクションの共通点は、ロックインと席課金からの脱却、そして自前運用への移行です。SNS、営業、通話と、マーケティング周辺の機能がオープンソースと自ホストで置き換えられていく、という流れですね。
葵: 次は少し雰囲気が変わって、世界モデルと創作AIの話です。まずOdyssey 3。Foundationによる世界モデルで、リアルタイムの物理シミュレーションを実現した、とされています。
悠真: 世界モデルというのは、現実の物理法則を学習して予測・生成できるモデルのことです。Physics-IQというベンチマークで最高スコア66.1を記録したと主張されていて、ロボットや自動車の制御にも応用できるとされています。
葵: ここは重要な区別として、ベンチマークスコアは「主張された結果」であり、私たちが実測したわけではない、という点を押さえておいてください。ただ、物理をリアルタイムでシミュレーションできるモデルができてくると、ゲーム、ロボット、映像制作と応用の幅が大きく広がります。
悠真: で、この日の話題は物理から創作へと移っていきます。HeyPiは、AI会議プラットフォームです。会話をライブで追跡して、会議中のアイデアをその場でアプリやデッキ、ウェブサイトに変えていく、と。
葵: 会議が終わってから議事録を作るのではなく、会議をしている最中に成果物が形になっていく。会議のアウトプットの定義自体が変わるかもしれませんね。
悠真: Playground by Google Labsは、Google LabsのAIゲームプラットフォームです。テキストでゲームを記述するだけで、コードを書かずにゲームを作れて、共有も、チャットでの調整もできる、と。
葵: テキストからゲームが作れるという話自体はだんだん珍しくなくなってきていますが、共有とチャットでの反復調整が一つのプラットフォームにまとまっている点が特徴でしょうか。
悠真: そしてRefs。これは3000本以上の映画を、カットの設計図とプロンプトのライブラリとしてまとめたもので、MCP経由でClaude Code、Codex、Cursorから利用できます。
葵: 映画を「カットの設計図」としてライブラリ化する発想が面白いですね。映像を作るときに「あの映画のあのカットのような構成で」と参照できる。しかもMCP経由なので、コーディングエージェントに映像制作の文脈を与えられる。
悠真: 最後がOpenVids。MacとWindows対応のオープンソース、エージェント型の動画編集アプリです。チャットで指示を出すとタイムラインを編集してくれる。レンダーQAとチェックポイントも付いている、と。
葵: チェックポイントとQAが付いている点は実用上大きいです。動画編集は失敗したときの手戻りが重いので、途中保存と品質確認の仕組みがあるかないかで使い勝手が変わります。
悠真: このセクションの流れを整理すると、物理を理解するモデルから、創作を補助するツールへ、と繋がっています。世界モデルが「世界を理解する」側で、HeyPi、Playground、Refs、OpenVidsが「創作を支援する」側です。
葵: 次は、モバイルと日常の端末の話です。まずAmazonのAlexaタブレット。229ドルからのAndroidタブレットで、Google Playが完全に使えて、Alexa+が内蔵され、Kindle読書モードも付いている、とされています。
悠真: AndroidタブレットにGoogle Play完全対応というのは、Fireタブレットのこれまでの閉じた設計からすると大きな変化です。しかもAlexa+を内蔵して、Alexaが端末の中心にある、という位置づけ。
葵: Amazonにとってタブレットは単体のデバイスというより、Alexaを家庭に浸透させる乗り物、という意図が透けて見えますね。
悠真: 次のPhonableは、iPhoneのボイスメールを置き換えるプロダクトです。着信を取れなかったとき、発信者にはSMSで連絡が行き、受信者には文字起こしとAIの要約が届く、という仕組み。
葵: これは「留守番電話」というかなり古い UX を、まったく違う形に組み替えています。発信者は音声メッセージを残す代わりにテキストで伝え、受信者は音声を聞かずに内容を把握できる。双方に合理的ですね。
悠真: RuneはMac用のテキストエディタで、19ドルの買い切りです。iCloud上の1つのスクラッチファイルをMac間で共有して、コンフリクトなしでマージできる、という特徴があります。
葵: 買い切り19ドル、という価格設定もサブスク時代には新鮮ですね。しかも「1つのファイルを複数のMacで使い、マージが衝突しない」というのは、複数台のMacを使い分ける人のためのシンプルな解です。
悠真: Thravikは、ChromiumでないネイティブのMacブラウザです。読んだページを端末内で暗号化して記憶するPrivate Memoryを持ち、コマンドKで検索できる、と。
葵: Chromium以外の独自エンジンという点は、ブラウザ市場の状況を考えると珍しい選択です。そしてPrivate Memoryが端末内で暗号化されている点が、この日の後半の「記憶」のテーマとつながります。
悠真: このセクションの共通テーマは、普段使いの端末がAI対応していく、そしてプライバシーは端末内の処理へ向かう、という流れです。タブレット、電話、エディタ、ブラウザと、一つずつ日常の道具が変わっていく。
葵: そこから自然に、仕事の学習とコンプライアンスを支えるツールの話へ進みます。Staffcoderは、ブラウザIDEで実際のエンジニアリングを練習できるプロダクトです。1000以上の課題と40以上の学習パスがあり、無料で始められます。
悠真: ブラウザだけで本物の開発を練習できる、というのは、環境構築につまずく学習初心者への入口として理にかなっています。課題と学習パスの組み合わせで、学びの順序が設計されている点も特徴ですね。
葵: Regunowは、コンプライアンス側のツールです。規制調査を平文で記述すると、AIが回答と権威あるソースを返してくれる。さらに文書の比較、ギャップ分析、構造化レポートの作成ができる、と。
悠真: 平文で質問を書くだけで規制調査ができる、というのは、専門ツールの操作を学ぶ必要がないという意味で実務家に優しい設計です。ただし、規制領域では回答の正確性が最も重要で、権威あるソースが付くとはいえ、出力を検証せずに使ってよいかは別の問題ですよね。
葵: その通りです。規制の解釈は間違いの許容度が低い領域なので、この手のツールは「回答の補助」として使う位置づけが現実的でしょう。エンジニアの練習と法務の調査、どちらも「実務家の支え」としてAIが入っていく方向を示しています。
悠真: 最後のテーマは、音声から記憶へ、という話です。Murmurというプライバシー重視の音声ファーストなメモアプリで、話した言葉が、意味検索とタスク抽出付きの検索可能な記憶になる、というものです。
葵: ここで、この日の流れを一つに結びつける話ができます。Meleteの永続記憶、ThravikのPrivate Memory、そしてMurmurの検索可能な記憶。三つとも「AIが記憶を持つ」という同じ流れの中にあります。
悠真: その中でMurmurが位置づけられるのは「個人版」です。しかも入力が音声という点が生活寄りですね。キーボードで打つ代わりに話すと、それが構造化された記憶として残り、あとで意味で検索できて、タスクも抽出される。
葵: メモという行為の負担が大きく下がる可能性がありますね。ただ、個人の音声が記憶として蓄積される仕組みである以上、どこにデータが保存され、どう暗号化されるかは、プライバシー重視を謳う以上、確認したいポイントです。
悠真: 全体を振り返ると、今日のラインナップは一つの大きな流れに沿っていました。エージェントがアイデンティティと記憶と実行環境を持ち始め、その動かし方は自分のキーとオープンソースで自前化が進み、日常の端末とメモまでもがAIと記憶を獲得していく。
葵: 一方で、未解決の問いも明確です。特にエージェントの自律性が高まるなかで、実運用の安全性と価格がどうなるか。Gemini Agentの自律計画も、Meleteの永続記憶も、Pine Computerの速度とコストの数字も、まだ主張の段階です。
悠真: ええ。数字や説明はメーカーの主張として受け取り、実運用での検証を待つ、というスタンスで、これらのプロダクトを見ていくのが良いと思います。
葵: 今日はこのあたりで。葵でした。
悠真: 悠真でした。また明日。