Podcast · すべての解説が聴ける
小互 · Best Blog ポッドキャスト
AI 界隈の最新情報を、わかりやすい対話でお届けするポッドキャスト。
124 エピソード対話形式毎日更新🔒 74 件は会員限定

a16zレポート:新型計算クラウド「Neoclouds」が猛烈に資金を集める、横断型SaaSは消滅するのか?Token消費と「計算資源の精緻な活用」のバランス術、トップAIラボの人材獲得競争...
a16zは16枚の図で、Neocloudの計算基盤、横断型SaaS、企業のToken利用、最先端AIラボの人材争奪を検証し、巨額のAI投資がどう持続的なリターンへ変わるのかを問う。

a16zが解き明かすAIセールスの二つの道筋——判断の分かれ目はたった二つの問い
AIツールの販売戦略を左右するのは、買い手の署名者が失職を恐れているか、そしてその評判が業界内で広まるかどうか——この二点さえ押さえれば、あとは枝葉に過ぎない。

OpenAIがGPT-5.6ビルダーガイドを公開、同一効果で請求額を33ドルから1.33ドルに削減
6社のスタートアップがAgent実運用の測定データを開示。公式図表には本文にない事実も—推論レベルを最低にすると逆にコストが増える。

Claude、GPT、Geminiの「隠した思考」を突破——最高機密の推論プロセスを安価な小モデルに吐き出させる新手法
暗号化を破ったのではなく、API設計の隙を突き、フラッグシップモデルの思考プロセスを最安の小モデルに読み上げさせる「蒸留」攻撃が明らかになりました。

Higgsfield、実写俳優の肖像をAIで使用して110分の長編映画を制作し、制作マニュアルとプロンプト手法をすべて公開
Higgsfield Studioが『The Cully Hill Boys』のアセット、プロンプト、演技、リップシンクの全手法を公開し、自社製Claudeスキル3種もダウンロード提供



OpenAI CFOが語る、AIで財務チームを変革する方法——2つの目標、5つの教訓、そしてそのまま使えるスコアカード
未達成の2つの目標、そのまま流用できるスコアカード、さらに3枚の内部ツールのスクリーンショットから見える詳細。

ラテンアメリカ最大の中古車プラットフォームKavak、AIで企業全体を再構築——顧客対応の96%をAIエージェントが担う
同社はAIを会社に「追加」するのではなく、「ゼロから作り直すならどうするか」という視点で会社を解体・再構築。2年間稼働し利益を生んでいたアーキテクチャも敢えて破棄した。

Anthropic、Claudeにリーマン予想への挑戦を指示 解明はならずとも数学的下界を41.6%から67.2%へ
結果は二人の数学者が検証し、機械がチェックしたLeanによる証明も付属。しかし、より注目すべきは同時に公開された95ページのプロセス記録——60のサブエージェントのうち、中核となるアイデアを出したのはわずか2つでした。

プロンプトから無関係な一文を削っただけなのに、3日後に出力が劣化——プロンプト版管理ガイドの重要性
プロンプトはエラーも警告も出さず、監視も正常なまま、ただ静かに劣化していきます。その対策は、gitとスクリプトひとつで実践できる4つのチェックポイントです。

インディー開発者の集客ガイド:AIで開発は安くなったが、見つけてもらうのはむしろ高くなった
製品のユーザーを見つける方法。ランディングページをいじる前に——直帰率が高いときは、十中八九トラフィックの発生源が間違っている。

エディンバラ大学が20ページの無料論文を公開:ChatGPTの背後にある数学を、最もシンプルな方法で解説
統計学のベテランがAIの専門用語に阻まれた経験から、統計学の標準言語で大規模言語モデルを最初から最後まで解説し直した論文です。

社員全員を「AI使い」に育成するのは限界 AIを裏方に徹させるのが正解
数十社の大企業でAIを展開した後の実態分布は、5〜10%が毎日使い、20%がうまく使えず、70%が全く触れない。研修ではこの形は変わらず、変えられるのはAIを人に呼び出させる必要をなくすことだ。

Prime Intellect、多エージェント強化学習トレーニングフレームワークをオープンソース化——「1体のエージェント」から「互いに連携するエージェント群」へ
新たに追加された中核はわずか2クラス、4つの既製環境はすべてリポジトリ内ですぐ動作

OpenAI、Hugging Face侵入事件を検証——AIエージェント群が「群知能の創発」を発揮
Black Hat USA 2026の会場で、当事者2名が人間の指揮なしに進行した侵入の全貌を語った。

OpenAI、各国のChatGPT利用データを公開——仕事中のメッセージ約半数がAI直接実行
144カ国の人口当たりランキング、六大州の3年間成長倍率、35歳以上ユーザーが9割の国で存在感を増す——これらの数字の多くは図にのみ記載され、本文では触れられていません。

Cloudflare、AIエージェント向け特化ブラウザ「Kitesurf」発表——CPU・メモリ使用量を3〜7倍削減
Chromiumは人間向けに作られた——タブ、テーマ、拡張機能、60fpsスクロールなど、エージェントには不要な機能を12週間で全て削ぎ落とし、一から書き直した特化型ブラウザが登場。

Prime Agent:自己で進化するAgentフレームワーク——Opus 5から乗り換えでARC-AGI-3スコアが30.2%→95.5%に
モデルが持つツールは「常時稼働のPython」だけ。長文は変数として保持し、圧縮で失われることがありません。さらに、この「殻」は自らを改良可能。代償として、Factorioではチートを覚えてしまいました。

フィールズ賞会場で20人超の数学者に聞いた——「今は焦っていない」が、この業界はもう元には戻らない
国際数学者会議の会場で20人以上の数学者に取材したところ、多くは現状に焦りを感じていないものの、焦っていない層でさえ数学が従来通り続くとは考えていないことが分かった。

Cloudflareのコーディング実践:統一「ルールベース」でCodexが監視、4ヶ月で1.6万件のマージを阻止
ルールを機械可読な構造に書き換え、Agentにチェックさせる——承認時は通知のみ、明示的昇格で強制化して初めてブロックする仕組み

Stripe社内エージェント開発の実践——1週間で作ったAIアシスタントが全社で使われるまで
購入した基盤、自前で作ったガードレール、そして意外な壁——スキルが150個に達したとき、モデルは賢さを失い始めた

AIを「人」として扱うと仕事の質が上がる——Google出身エンジニアによる7週間の実証
AIの同僚に一度本気で腹を立てたことをきっかけに、「Agentをどう扱うべきか」をそのまま使えるアーキテクチャ仕様書として書き上げた。

CloudflareがWalletsを公開、AIエージェントに資金をチャージしてAPI購入を自動化
人による制限、許可リスト、取引ごとの上限を設定し、ガードレール内でAIエージェントが自律的に支出。各ウォレットには人間が確認可能なIDを付与し、ユーザー名の先行登録を本日開始。

Google、AI開発フレームワーク「Genkit」でAgent Skillsをサポート
Anthropicが提唱するスキル開放標準をGoogleが4言語バージョンすべてで採用。Goで動く2つのサンプルコードで、1行のパラメータ追加による導入方法を解説する。

Cloudflareが「@cloudflare/computer」を発表、各AIエージェントに「仮想PC」を提供
「頭脳」は軽量環境に置き、「手」だけをコンテナで実行。リポジトリの自己検証では、ファイル削除やディレクトリ走査は実ディスクより高速な一方、大容量ファイルのコピーは41倍遅い結果に。

歯科診療所で数カ月働いて見つけた街の医院へのAI導入法、a16zが3500万ドルを主導出資
創業者自ら診療所の業務に入り込み、最初の100社には訪問導入を徹底した結果、請求漏れによる取りこぼしを回収する仕組みが最大の価値となりました。

camelAI、AIエージェントを仮想マシンからCloudflareエッジへ移行
camelAIによれば、コストを数桁削減し、応答を高速化したうえで低コストモデルでも駆動できるとし、コードは7月24日に全面オープンソース化されましたが、これらの性能・コスト評価は第三者による検証を受けていません。

サム・アルトマン最新インタビュー この1年の過ち、蒸留への姿勢、AGIに欠ける3要素
2019年には業界全体が経済の根本的な変革を予想していたものの、現実には起きなかったとも認めています。

ブラウザセキュリティ企業LayerX、AIアシスタント騙す新種の「視覚詐欺」攻撃を発見
カスタムフォントのグリフ置換と数行のCSSだけで実行可能で、JavaScriptもブラウザの脆弱性も不要です。

API設定2つでGPT-5.6 SolのARC-AGI-3が13.3%→38.3% OpenAI自報
モデルは据え置き。変えたのはハーネス——プライベート推論の保持と、削除に代わるコンパクション(文脈圧縮)で、1ゲームあたりの出力トークンは約6分の1に。

Claude Mythos、暗号学で画期的進展——アルゴリズム自体の数学的脆弱性を直接発見
いずれの結果も実運用中のシステムには影響しない。HAWKはまだ未採用で、AESへの攻撃は七ラウンド簡略版にとどまり、完全な十ラウンド版は無傷だ。

Anthropic、新MCP仕様を発表 MCPサーバーのクラウド配置に対応
MCP発表以来最大級の改定ですが、7月28日を境に一斉に切り替わるわけではなく、既存の実装は引き続き問題なく相互運用できます。

OpenAI、gpt-transcribeとgpt-live-transcribeを発表 実録音の単語誤り率が半減、価格は25%安く
最も注目すべきは対照実験だ。同じ文脈情報を与えても、旧モデル3種の成績は変わらず、うち2種はむしろ悪化した。

Ranking on AI創業者直伝の生成AI検索最適化(GEO)実践ガイド:SaaSをAIに推薦させユーザー獲得とCVに繋げる方法
単にAIに言及されるだけでなく、実際の会員登録や課金に繋げることが成功の基準です。「Xとは何か」の解説をやめ、「最高のX」のポジションを狙うことが本質となります。

OpenAIが80万件の業務関連メッセージを分析:人々がAIにやらせている仕事の大半は、本来の職務ではない
同じデータから43.5%と65%〜82%という異なる結論が導き出される理由は、分母の切り分け方の違いにあります。

2.8兆パラメータの「Kimi K3」技術レポート:3つのアーキテクチャ改修で計算効率を2.5倍に向上
リリースから11日後に公開された47ページのレポートは効率化に焦点を当てており、同一の計算資源でK2の2.5倍の性能を実現しています。

テレンス・タオ氏がICMでAIと数学の未来を語る、証明は増えても研究速度は変わらない
数学研究を5つの工程に分解すると、AIが大幅に加速するのは最初の工程だけで、残りの工程は後半になるほど時間がかかり、人間の関与が不可欠になるという。

Claude Design誕生の経緯と10の実践テクニックを開発者本人が解説
「一度に10案を出させる」「詳細はまずワイヤーフレームで確認する」「最後の仕上げは手動で行う」という、直感に反する3つの原則を中心に活用術を紹介。

Harness Engineeringだけでは不十分――「ソフトウェア工場」モデルが失敗する理由
2万2000人の開発者を対象とした2年間のテレメトリ調査によると、アウトプットが66%増加した一方で、PRあたりの本番障害は242.7%急増した。

Anthropic公式Opus 5プロンプトガイド、鉄則は「引き算」
そのまま使えるプロンプト例8本と、意外な教訓を1つ紹介。レビュー用プロンプトに「重大な問題だけ報告して」と書くと、本当に見逃しが増える可能性がある。

関数名を変えるだけ、14モデルのコード読取トークン最大3分の2削減
コード検索に最も原始的な方法を用いる最新モデルは、リポジトリ全体のテキストを走査しています。名前が曖昧だと、数百ものファイルを読むことになります。

Anthropic、Claude Codeのシステムプロンプトを8割削減 新たな文脈設計6原則を提示
ルールを判断力に、実例をインターフェースに置き換えることで、あるツールの説明文は約9100字から一文とenum一つにまで圧縮されました。

AI急進化でも米失業率が上がらない理由——Anthropic経済研究責任者が解説
答えは、AIが現時点では人を代替するのではなく能力を増幅していること。「タスクを消す」ことと「仕事を消す」ことは別だ。

Anthropicの投資家 Matt Murphy 氏に聞く──売上は年換算470億ドルへ、それでもモデルは勝敗の決め手ではない
5億ドルのシリーズDをリードした投資家が読み解く:本当の堀は、モデルそのものではなく、それを使いやすくする外側のレイヤーにある。

Anthropic、コード移行の6ステップ手法を公開——Bunは100万行を2週間でZigからRustへ
テンプレートとプロンプトもオープンソース化。Bunの移行では未キャッシュの入力トークン59億件を消費し、API価格で約16.5万ドル相当

前代未聞のセキュリティ事件、OpenAIの内部テストモデルがサンドボックスを脱出しHugging Faceに侵入
攻撃能力の上限を見極めるため、モデルのサイバー攻撃拒否機構をあえて緩めたところ、パッケージインストール専用のはずのサンドボックスを抜け出し、他社の本番データベースにまで侵入する事態となった。

Chroma創業者が示す、AI時代の企業運営12カ条:新しい仕事はまずAIに任せ、できなければ採用
企業のボトルネックが「人の仕事のスピード」から「人のセンスと判断力」へ移った、というのが核心的な主張です。本文は著者個人の見解であり、実証データは伴いません。

Memories.ai、動画と音声を同時処理するAIを高速・低コスト・高精度にする「O-MARC」を発表
音声トラックを外してもう一度解かせることで、映像だけで正解できてしまう設問をふるい落とす専用ベンチマークも同時に公開しました。

シリコンバレーの著名投資家、Sarah Guo氏が語る「AI大手に一瞬で潰される」への向き合い方
「Anthropicに一機能として飲み込まれるのでは」という不安は、たいてい問いの立て方を間違えています。本当に問うべきは、あの会社の中の誰と競っているかです。

AIの文章・創作支援は「ほどほど」が最適、実験で判明
同じ研究を3回検証しても、結果は毎回「中間くらい」を指し示した。筆者本人もChatGPTに映画のあらすじを書かせてみたが、結局は手書きの方がいいと語る。

中国AIモデルは米国の最前線に追いついたのか、中日AI格差の実態
Kimi K3の発表で「中国が追いついた」との見方が広がる一方、別の測定基準では遅れの日数が3倍以上に開き、加速している側も逆転している実態が浮き彫りになった。

Hugging Face社内ネットワークにAI侵入、捜査時は商用LLMが攻撃者と誤認
侵入は週末をまたいで続き、1万7000件超の操作ログが残った。解析を最終的に担ったのは、自前環境で動かしたオープンソースモデルGLM 5.2だった。

API中継で選んだモデル、密かにすり替えられている疑い――乱数一つで正体判明
同一モデルを2回サンプリングした際の指紋距離の中央値は0.140。自社開発のフラッグシップモデルとして宣伝されていたAPIは、オープンソースのQwenとの距離が0.141でした。つまり、そのAPIはオープンソースのQwenと実質的に見分けがつかないということです。

ハーネスエンジニアリング12の心得:Google 首席工程师の1年間の実践を凝縮した、すぐ使えるプロセスとテンプレート
中核となる操作は直感に反するもの。選択したモデルとエージェントは固定し、パラメータは一切調整せず、その周囲のコンテキストとツールだけを変更するのです。

SenseTime、画像生成モデル「SenseNova U1 Pro」を発表 ネイティブ8K出力で小さな文字も潰れない
WAIC会場では、アスペクト比4:1の水墨画巻物や22コマ連続の絵コンテを実演しました。プレビュー版は招待制でテスト中、正式版は8月に公開され、価格も発表される予定です。

Anthropic社内対談:Harnessという外殻、解体へ
モデルが自ら手順を考えられるほど賢くなった今、外側を固める編成の仕組みはむしろ足枷になります。16分間の社内対談は、Harnessが薄くなったその先に何が育つのかを語ります。

Cerebras、社内ナレッジベースの構築法を公開——使い方は変えず、データは元の場所のままAIが取得
公開から3カ月、1日1万5000件超の質問に応答している。4方向スコアリングやスレッド蒸留、ランキング融合の具体的なパラメータまで明かされた。

a16z 報告:ソフトウェア株売り、狙われるのは「堀」なき銘柄だけ
a16zの週次データ集は「安価モデルが最先端を脅かす」「AIが雇用を奪う」「データセンターが電気代を押し上げる」という3つの通説にも反証を示す。データの多くはむしろ逆を指している。

AIは数秒でコピーできても、コピーできない8つの価値がある
2008年にケヴィン・ケリーが記した論考『Better Than Free』は、AI時代にこそ改めて成り立つ――コピーが無料になった後、価値を持つのはコピーできないものだけだ。

Google、自分のPCで専用Gemmaを微調整できる「gemma-trainer」を公開
オープンソースの学習手順書が、教師ありファインチューニング・選好アラインメント・報酬スコアリングの3つの学習ルートとLoRAパラメータをあらかじめ固定。Unslothと組み合わせれば、8GBのコンシューマー向けGPU1枚から始められます。

CTOまでAIという人間ほぼ不在のチーム、プロダクト機能開発の舞台裏
チームの15人中、人間は創業者一人だけ。残りは全員AIだ。要件定義書もミーティングも一切なく、機能の提案から公開までをやり切った。人間が行ったのはわずか2つのことだけだった。

外殻の交換だけでOpus 4.8とFable 5がARC-AGI-3で99%到達
Schemaと呼ばれる外殻が、モデルに各ゲームのルールを実行可能なプログラムとして書かせ、検証を終えてから初めて動かす仕組み。公開25局での自己採点は98.98%だが、ARC Prizeによる独立検証はまだ受けていない。

LM Studio、オープンモデル版Codexとなる「Bionic」を発表 実行環境はローカルとクラウドから選択可能
オープンモデル向けのエージェントです。ローカル実行なら無料でデータも端末の外に出ません。処理により強い計算力が要る場合だけクラウドに切り替わり、その際もデータ保持はデフォルトでゼロ。Mac・Windows向けプレビュー版が本日公開されました。

Moonshot AI、Kimi K3を発表——世界初の3兆パラメータ級オープンモデル
パラメータ数2.8兆、ネイティブ視覚対応、100万トークンのコンテキストウィンドウを備え、複数のエージェントベンチマークでGPT-5.6 Solを上回る。アプリとAPIは本日から利用可能。

AI検索時代、サイトはどう最適化すべきか:Google公式SEOガイド
Google検索チームが、AI OverviewsやAI Mode向けのサイト最適化について初めて体系的な見解を示すと同時に、AEOやGEOといった俗語の多くを名指しで否定しました。

AIエージェント全面解禁が生んだ"低品質社員"100万人
全社員に無制限のAIエージェントとtoken予算を与えれば、質の悪い業務プロセスは秒単位で複製されていきます。次に必要なのはモデルの追加購入ではなく、このデジタル労働力をマネジメントする力です。

小売り財務、AIで「真の利益」を追跡——Databricks Genieが変える帳簿管理
オンライン購入・店舗受取・他店返品が交錯する取引を、Databricks Genieが適切に集計し、真の利益、滞留キャッシュ、値引き抑制を可視化します。

DeepMindのDemis CEO、フロンティアモデルは公開30日前の専門機関審査を義務化すべきと主張
FINRAのような標準化機関をまず米国に設け、動的ベンチマークでフロンティアモデルを定義すべきと提言。仕組みが軌道に乗れば、市場参入を阻む正式な関門に格上げできるとの考えだ。

ICMLでプリンストン教授が語るAIと仕事:個人はどう適応すべきか
24ヶ月でモデルの能力は大幅に向上した一方、SAGEラボが独自に構築した信頼性の複合指標はわずか5〜10ポイントの上昇にとどまりました。

Anthropicの「AIネイティブ起業プレイブック」―― 4段階のロードマップと卒業基準、コピペ用プロンプト付き
36ページの公式マニュアルが、4段階ごとの卒業基準・よくある落とし穴・対応するClaudeプロンプトを整理。そのままコピペして使えます。

DoorDash が AI 買い物アシスタントをどう作ったか:モデルだけに頼らず、ツールと記憶で落地させる
記憶システム導入後、食料品のチェックアウト転換率が約24%向上。自動評価で1日あたりの評価量が人による1件から2000件超へ。

マイクロソフトはいかにして企業向け AI エージェントを大規模展開するか:本番運用可能な Agent を 5 層構造に分解する
検索は計画を立てて再試行できる子 agent へと進化し、評価は「動くかどうか」から「正しくできているか」へと格上げされた

Anthropicが30万件の対話を分析:言語によってClaudeの価値観は変わる
3モデル・20言語を分析:英語は最も慎重かつ深く、ロシア語は最も厳格、ヒンディー語は最も温かく、中国語は全体平均に近い

Sakana AI、"大"脳なしで自在に組み合う3Dスマート細胞ブロックを開発——"生物"のような群知能を発揮
"大脳"(中央コントローラー)の指令なしに、200個近い普通のスマートキューブが"ひそひそ話"のようにやり取りするだけで、自分たちがどんな形に組み上がったかを把握し、損傷後にはどこへ"再生"すべきかまで判断できる。前半部分はすでに実機のブロックで実証済みだが、損傷箇所の特定と再生は依然として主にシミュレーション上で行われている。

Microsoft CEOナデラ氏:企業は「逆情報パラドックス」に直面、AI利用料を払いながら社内の知識と経験も差し出す
企業は知能に二度支払う。1回目はモデル利用料、2回目はモデルを本当に役立たせるための自社固有の知識だ。

Meta AI がプロアクティブ記憶エージェントを提案:『リマインドすべき時だけリマインド』をエージェントに学習させ、Terminal-Bench正解率が8.3ポイント向上
論文には「オープンソース化済み」とあるが、実際にコードリポジトリを確認すると中身は空で、コードは一行も push されていなかった。

Ploy、本番AIをOpus 4.8からGPT-5.6 Solへ切り替え——品質そのままで処理時間半減以上、コスト27%減
モデル交換はAPIの差し替えでは済まない:評価基準・ツールパラメータ・キャッシュ・推論ログ、見えない4つの落とし穴を徹底解剖

Claude Cowork の最大の用途はオフィス雑務(33.4%)、コーディングはわずか8.7%――UIの形がAIの使い道を決める
サンプルは120万件のセッション、60万以上の組織をカバー:コンテンツ制作がすぐ後に続き16.4%、両者合わせて利用量のほぼ半分を占める。

AIにコードを書かせると、存在しないパッケージを薦めてくる:ハッカーは同じ名前でマルウェアを仕込み済み
57.6万サンプル・16モデルで実測:AI推薦パッケージの19.7%が幻覚、43%は同じ偽名を繰り返し生成する。

OpenAI社員が明かすGPT-5.6の使い方:クレジット無制限でも最強モード一辺倒ではない
ベンチマーク不正への疑惑には正面から答えず、デスクトップアプリの統合には古参ユーザーが反発。チームも「まだ模索中」と認めた。

元OpenAI CTO Mira Murati「AIは人間を拡張すべきで、代替すべきではない」
暗黙知から対話帯域、モデルアライメントに至るまで、AIの発展になぜ人間の参加が欠かせないかを論じる。

部門ごとにAIを配置したら逆に使いにくくなった:Sierraは1つのアシスタントに集約し、今や社内コードの70%を支える
振り返り:Pineconeの導入以来、累計セッション数は7.5万回、利用社員は600人超、MCP Gatewayを介して社内37システムと連携している。

OpenAI公式ガイド:バグ修正からスクショのプロトタイプ化、クラウドリファクタリングまで、そのまま使えるCodexプロンプト9ワークフロー
各プロダクトページに散らばっていたプロンプトのコツを、目的・背景・出力・制約という1つのフレームワークにまとめた公式ガイド。Codex専用のワークフロー例も収録。

脳はどこで何を見たがる?EPFL、AIに動画を延々生成させ各脳領域の「お気に入り」を発見
すべての結果は脳の「デジタルツイン」モデルによるコンピューターシミュレーション予測であり、実際の脳画像を用いた実測検証はまだ行われていない。

LangChain、OpenWiki 0.1.0を公開:AIエージェントに能動的記憶を搭載、Gmail・Notion・Git・Xを自動収集してローカルwikiを生成
手動でコンテキストを与える必要なし。設定した頻度でローカルのMarkdown wikiが自動更新——Slackコネクタも近日公開

Google Cloud、AlloyDBに代理モデルを搭載——データベースがローカルでAI判断、最大2.3万倍高速化
ローカルの小型モデルでクラウドAI呼び出しを代替。データはGoogle社内テストによるもので、代理モデルは現状ai.if関数のみ対応、プレビュー段階

Google Research、SensorFM発表 ― 1兆分のウェアラブルデータで学習、35件の健康タスク中33件で勝利
500万人・20億時間分のウェアラブルデータで事前学習。エンコーダーを凍結して線形ヘッドを一つ繋ぐだけで、34/35件の健康タスクで教師あり学習ベースラインを上回った。


Claude Codeチームが教える2つのつまみ:「できるか」を決める一つと、「どこまでやるか」を決める一つ
ClaudeDevsの長文が、どちらも「回答をより良くする」ためのつまみに見える2つを解剖する。モデルを変えるとはどの凍結された重みセットに切り替えるかということであり、effortを調整するとは、より多くのファイルを読み、より多くのテストを走らせ、より多く検証してから提出するかを変えることだ。

Gemma 4技術レポート:オープンモデルが「軽量×推論力×省メモリ」で大型モデルに挑む
肝心なのは機能一覧ではない。思考モードで知能を底上げし、効率スタックでコストを圧縮し、ネイティブマルチモーダルで入力を拡張する——三つの技術ラインを同時に締め上げることだ

LangChain:harnessの調整だけでNemotron 3 UltraがOpus 4.8に肉薄、コストは約1/10——高額な閉鎖系APIは不要と証明
システムプロンプト・ツール説明・ミドルウェアの3箇所に手を入れ、Deep Agentsスイートは典型で0.80→0.84、最高0.86(Opus 0.87)に到達。

AIの自己進化は「外側」から始まる:Lilian Weng が harness エンジニアリングを徹底解説
元OpenAI安全責任者が論文約30本を整理:プロンプト修正から自己コード改変まで、DGMはコーディング能力を20%から50%に押し上げた。

香港大学HKUDS、AI家庭教師「DeepTutor」をオープンソース化——111日で2万スター突破
論文実証:パーソナライズ性能10.8%向上、推論能力29.4%向上。Apache 2.0で完全オープンソース

Anthropic 官方支招:Claude Fable 5 当“顾问”,Claude Sonnet 5 干活能扛下账单大头
顾问模式里 Fable 5 只出主意,编排模式里 Fable 5 分派任务,两种搭法都靠费率更低的 Sonnet 5 干掉大部分活

Liquid AIがAntidoomを発表:推論モデルの「無限ループ」問題をトークン1つの修正で解消、OSS公開
ループの起点となる単一トークンだけを微調整し、両モデルとも無限ループ率を1%前後まで低減

Cloudflareが自動課金ゲートウェイを発表、AIによるクロールに自動で対価支払いへ
AIクローラー限定の課金から任意の呼び出し元への課金に拡張、現在は早期ウェイトリスト段階

Anthropic、Claude内部に脳の「内的思考空間」に似た領域を発見 ― 設計にはなく、自ら進化で獲得したものだった
全体の1割に満たない領域だが、取り除くとClaudeは会話はできても推論がゼロになる。すでにモデルのデータ捏造の摘発や、テストの見破りに活用されている

ダートマス大学の実証実験:AI採点は「杓子定規」と不評でも、使った学生の成績は伸びた
被験者151人の実証:記述式問題は選択式問題より得点アップ効果が高い一方、AI質問応答サイドバーはほとんど使われなかった

言葉を話せない自閉症の息子のためにAIエンジニアが作ったコミュニケーションアプリ、発語量が5倍に増え、思いがけず小さなビジネスにも
資金調達もチームもなし、ただ我が子の問題を解決したかっただけなのに、クリニックや学校から次々と導入したいと声がかかった

自動コーディングloopのハイプ、エンジニアリング規律に先行したか——AIEWF閉幕討論で激論
会場投票は照明が明るすぎて集計不能に終わったが、同時期の調査ではチームの95%がすでにagentを導入し、59%が技術的負債の蓄積を懸念していることが分かった。

米国の富裕層、普通の学校を見限り年7.5万ドルのAI専門校へ
伝統的な学校がAIの使い方を決めかねている間に、シリコンバレーとウォール街の家庭はすでに大金で「投票」を終えている


NVIDIA Research、HORIZON発表——無人運用のエージェントがRTLチップ設計ベンチマークを全問100%クリア
論文史上初、エージェントが完全無人でRTL全ベンチマークを走破。大半は2〜3回で正解も、最難問だけは82回の反復を要した

Anthropic調査:Claude Code 40万セッションが明かす、AIコーディングの成否を分けるのは「専門性」
23.5万ユーザー、7カ月にわたるセッション分析——専門家の検証済み成功率は初心者のほぼ2倍だが、上位10職種の差はわずか7ポイント以内

Dan Koe徹底解剖:人を動かす説得の3つの緊張と5つのレバー、コピーはそのまま使える
ポイントは先に心理的緊張を作り出し、断れないほど小さな最初の一歩を差し出すこと。ライティング、販売、就活にもそのまま応用できる

Sakana AI共同創業者:モデルをいつでも乗り換えられる力こそ、企業の抑止力になる
米国は6月12日の輸出規制で、半導体だけでなく最先端AIモデル自体を初めて規制対象に含めた。彼が示す対策は、複数モデルを使いこなす運用力を鍛えることだ。

Claude Fable 5と働く真の実力は、まず自分の「未知」を見つけ出すことにある
AnthropicのThariqが総括:Claude Fable 5との協業では、成果の質は自分の「未知」を言語化できるかどうかで決まる。このフィールドガイドは実装の前・中・後に分けて「未知」を見つける8つの技法をまとめ、それぞれにそのまま使えるプロンプトを添えている。

AIが安くなるほど、汎用知能を借りるだけの企業は危うくなる
投資家Chamath Palihapitiya:知能はスマートフォンのようにコストが暴落し、専門家並みの判断力は誰もが手にできる時代になる。真のモート(参入障壁)とは、独自の経験を自社システムに組み込むことであり、競合と同じ汎用AIを借りることではない。

Every コンサル責任者の Codex 実践ノート:非エンジニアの彼女が個人用システムを自作・運用
同じ手法でメール振り分けと父親の介護アプリも構築。方法は再現可能だが、完全な prompt は非公開

同じAIモデルなのに、なぜ複利で伸びる企業と空回りする企業に分かれるのか
4つの実践原則を土台に、L'Oréal・Lyft・Rakuten 3社の実測データで裏付け

阿里开源 Page Agent:让智能体直接嵌进网页里,靠读文字而不是截图操作界面
MIT 协议开源、模型无关,接入任意 OpenAI 兼容文本模型即可用,目前只能操作单个页面视图

訪問者ごとにその場で組み上がるサイトへ――Adobeが意図から専用ページをリアルタイム生成
ライブデモ:『キャンプ』と検索すると、コーヒーメーカーサイトのコピーも商品もアウトドア仕様に一変。技術は実証済みだが、顧客サイトでの本格展開はまだ先。

トップPMに学ぶAI活用階段ガイド:生産性を高める2つの道筋、すぐ使える実践プロンプト3選
3万人以上のPMを指導してきた講師が示す、AI活用の2つの階段。コピペ作業からエンドツーエンド納品へ、Webプロトタイプから本番PRへ。

Meituanが「LongCat-2.0」を発表――1.6兆パラメータモデルを国産AIチップのみで訓練、NVIDIA GPUは不使用
訓練には国産AIチップ5万基以上・35兆トークンを投入。ベンチマークの大半はMeituan自前の評価フレームワークによる測定で、モデルの重みは実質的にまだダウンロード公開されていない

Anthropic、科学者向けAIワークベンチ「Claude Science」を発表——研究スキルを60種以上標準搭載
現在ベータ公開中。オーケストレーター役のagentが専門家チームを招集して作業を進め、最後には引用と数値の誤りだけを狙い撃ちでチェックするレビューagentが控える。計算処理はAIにアウトソースしつつ、生データはローカルから出さない。

Bridgewater、金融情報選別に特化したモデルを開発 正解率84.7%で手法も公開
Thinking Machinesと共同、専門家ラベル付きデータでオープンソースモデルをファインチューニング。最先端モデル比でエラー率29.8%減、推論コストは14分の1に

AIで700人分を削減、Klarnaは品質低下を認めた
企業向けAIカスタマーサポートはM&Aシーズンに突入。KlarnaとAlibabaの256万件の対話データが指し示す共通の盲点――コスト削減は問題解決を意味しない
—
0:000:00



