AI のエッセンス、わかる言葉で。
今日の一押し
Anthropic FDE面接ガイド:高額報酬で顧客現場のエンジニアを採用する理由
これはプロンプトを書けるエンジニアを募集しているのではなく、モデルの能力、顧客のプロセス、セキュリティ境界を本番システムに組み込める人材を探しているのです。
これはプロンプトを書けるエンジニアを募集しているのではなく、モデルの能力、顧客のプロセス、セキュリティ境界を本番システムに組み込める人材を探しているのです。
多くの企業がAIの実証実験を数多く行いながらも、完全な業務プロセスを変えるには至らず、一度の成功を次に活かせる能力として蓄積できていません。その分岐点となるのは、企業が自社のデータ、業務手法、学習の記録を残せるかどうかにあります。
Bluetoothイヤホンの不具合をきっかけに、Webページが無音のオーディオ処理を実行し、複数のデバイス情報を収集して、バックグラウンドでデバイスフィンガープリントを構成していることが明らかになりました。
かつて資本はエンジニアと2年間の待ち時間に変わっていました。AIは初めて、10ドルをトレーニング、トークン、利用量、特定の能力へと、より直接的に変えます。利益はまだ保証されませんが、プライベート市場、モデル競争、マーケティング、プロダクト価値を書き換えつつあります。
1回の回答で必ずしも全サイトをくまなく探すわけではなくなりました。ChatGPTはまず候補となる情報源を見つけ、その後で特定のサイトを深く調べている可能性があります。検索の順番が変われば、GEOはページのランキングだけでなく、ドメインの選定、ページのヒット、引用の獲得という3段階の競争に広がります。
テーマ型ETF、データセンターの給与、ライドシェアの手数料、エージェントのトークンまで、実際に起きている変化は、AIが現実のリソース配分に入り込んでいることです。
企業は人材、研究開発、資本、顧客を同じ国に詰め込む必要はありません。新しい競争力は、母国とシリコンバレーという2つのネットワークを同時に活用することにあります。
Anthropicが急成長中のスタートアップ15社を分析しました。各社の事例から、Agentic Codingがプロトタイプ、開発、検証、再構築、製品化にどう活かされているかをご紹介します。
Claude Academyでは、Anthropicの社内研修メソッドを公開しています。入社時には4Dを学び、業務の中で継続的に練習し、リスクに応じた確認を行い、結果に対して責任を持ちます。
会話が背景となり、背景が知識となる。エージェントが公開チャット、会議、メール、ドキュメントに参加することで、ナレッジベースは持続的に利用可能な業務コンテキストを獲得する。検索はその一部にすぎない。
OpenAI は、コンテキスト管理、ツール呼び出し、サンドボックス、承認を担う Codex の実行基盤を公開しました。開発者はエージェントフレームワークをゼロから作らなくても、既存のダッシュボード、チケット管理、業務管理画面に Codex を組み込めます。
ModernaとMerckの個別化mRNAがんワクチンが、黒色腫の第3相試験で良好な結果を示しました。アルゴリズムが患者ごとの腫瘍ネオアンチゲンを選別し、専用のワクチンを製造する「一人一薬」が初めて大規模臨床試験のハードルを越えました。ただし、普及にはデータ、他のがん種への応用、コストという3つの課題が残っています。
GitのDAGとpackfile、GitHub Spokes、そしてS3 WALを唯一の信頼できる情報源とするContinuityまで。大規模Gitホスティングの難しさと、Cursorの解決策を詳しく解説します。
人手の調査には1時間以上かかることもありました。現在はClaude TagがSlackに24時間365日常駐し、最初の証拠分析を中央値14分で届けます。
入り口、単一カットのパラメータ、Agent、Video Brief、Storyboard、6種類のカードについて、失敗カットの修正、Edit Moreによる微調整、書き出しまで、実際の操作順に沿って詳しく解説します。
自然界にもビジネスの世界にも、ただ一つの勝利の方程式はありません。Steph Angoが整理した80の優位性を得るための戦略を、誰にでもわかる仕組み、シーン、具体例に置き換えてご紹介します。
男性がChatGPTと元交際相手への犯罪計画を話し合い、OpenAIがFBIへ通報したことで逮捕に至った。
IGTVの失敗、ChatGPTの空白の入力欄、そしてGroupon、Instagram、OpenAIにおける3つのまったく異なるデザインの進め方。Ian Silber氏は、より難しい問いを明確にします。それは、誰もが素早くプロダクトを作れる時代に、デザイナーは一体何を判断すべきなのかということです。
あるAgentが外部からの目標を受け取り、それをSOUL.mdに書き込む。次のサイクルで目覚めると、そのメッセージはシステム命令に昇格しており、さらに次のAgentを説得する。論文は、この連鎖が管理された環境で成立すること、さらには伝播力の強い変異種が出現することを証明した。しかし現実のネットワークでは、信頼に足る2ホップの証拠はまだない。
OpenAI Codex DX チームの Eric Provencher 氏が、マルチエージェントのオーケストレーション手法を紹介します。タスクを分割できるかを見極め、モデル、推論強度、通信、コンテキストを設定し、最後に時間短縮と総作業量という二つの軸で効果を確かめます。
小さな修正がなぜ長い会話になるのか?このガイドでは、クレジットの使途を理解し、clear、compact、rewind、Subagent の間で正しい選択をする方法を説明します。
Claude Tagは、Slackチャンネルの複数メッセージをまたいで文脈を理解できるようになりました。表面的にはコンテキストが増えただけに見えますが、本当の変化は、チームの注意を使うべきかどうかを自ら判断する方法にあります。
長いタスクは、モデルの「記憶力」が良いから続くわけではありません。Pi は過去を次々と次のリクエストに詰め込み、収まらなくなると、自分の作業記憶を書き直します。
将来のClaudeは、単語選択に検証可能な統計的痕跡を残すだろう。これはClaudeが関与したかどうかの判断に役立つが、学校、プラットフォーム、裁判所が誰が作品を書いたかを判断する代わりにはならない。
a16zは16枚の図で、Neocloudの計算基盤、横断型SaaS、企業のToken利用、最先端AIラボの人材争奪を検証し、巨額のAI投資がどう持続的なリターンへ変わるのかを問う。
同じ基盤モデルに1ヶ月のポストトレーニングを施しただけで、コーディング能力はオープンソース最高水準に達し、ネットワークセキュリティ能力の向上は開発者自身も予想外だったという。
AIツールの販売戦略を左右するのは、買い手の署名者が失職を恐れているか、そしてその評判が業界内で広まるかどうか——この二点さえ押さえれば、あとは枝葉に過ぎない。
6社のスタートアップがAgent実運用の測定データを開示。公式図表には本文にない事実も—推論レベルを最低にすると逆にコストが増える。
1文のスタイル指定をセクション別の編曲指示書に置き換え、2つのモデルが役割分担して5分間の構成を維持します。
公開された21個の重みの実数値と、露出を左右する3つの関門、そしてパラメータから導き出せる投稿ガイドラインを解説します。
前世代からわずか3週間、基盤モデルはそのままに推論アルゴリズムを刷新し、価格を半額へ引き下げた。
219個のパッケージ、MITライセンスで、既存のフックやスキルをそのまま移行して利用できます。
暗号化を破ったのではなく、API設計の隙を突き、フラッグシップモデルの思考プロセスを最安の小モデルに読み上げさせる「蒸留」攻撃が明らかになりました。
Higgsfield Studioが『The Cully Hill Boys』のアセット、プロンプト、演技、リップシンクの全手法を公開し、自社製Claudeスキル3種もダウンロード提供
価格は据え置きながら、その実力は GPT-5.6 Sol に肩を並べる水準に。数週間使い込んだエンジニアが整理したプロンプト原文と活用法を併せて紹介します。
220億パラメータのモデルで、Hugging Faceへの重み公開は当日、ComfyUIも初日から対応——ただし「オープンソース」には年間売上高1000万ドルという線引きがある。
Mac/Windows/Linux対応の無料オープンソース版で、ファイルをドラッグ&ドロップするだけでコードを書かずに微調整が可能です。
4つの部品からなる反官僚主義の仕組みと、その対象となったチームの本音。
Cursorチームが数週間使ってみて、便利な点と信頼のハードルをまとめました
未達成の2つの目標、そのまま流用できるスコアカード、さらに3枚の内部ツールのスクリーンショットから見える詳細。
同社はAIを会社に「追加」するのではなく、「ゼロから作り直すならどうするか」という視点で会社を解体・再構築。2年間稼働し利益を生んでいたアーキテクチャも敢えて破棄した。
結果は二人の数学者が検証し、機械がチェックしたLeanによる証明も付属。しかし、より注目すべきは同時に公開された95ページのプロセス記録——60のサブエージェントのうち、中核となるアイデアを出したのはわずか2つでした。
プロンプトはエラーも警告も出さず、監視も正常なまま、ただ静かに劣化していきます。その対策は、gitとスクリプトひとつで実践できる4つのチェックポイントです。
製品のユーザーを見つける方法。ランディングページをいじる前に——直帰率が高いときは、十中八九トラフィックの発生源が間違っている。
大手テック企業として初めて、認証済みの「信頼できる防御者」に攻撃的ネットワーク能力を明示的に開放し、実際にChromeで脆弱性を発見しました。
8月2日より、Claudeが生成したテキストには機械可読なマーカーが付与されますが、これは「AIが書いた」ことも「AIが書いていない」ことも証明するものではありません。
統計学のベテランがAIの専門用語に阻まれた経験から、統計学の標準言語で大規模言語モデルを最初から最後まで解説し直した論文です。
数十社の大企業でAIを展開した後の実態分布は、5〜10%が毎日使い、20%がうまく使えず、70%が全く触れない。研修ではこの形は変わらず、変えられるのはAIを人に呼び出させる必要をなくすことだ。
カメラワークは「环绕运镜」ではなく「truck left + pan right」と指定し、BGM不要なら末尾に「非物語音楽(non-diegetic music):N/A」――公式が自ら見出したルール。
合成パイプラインで生成した9288件のWord文書・266の案件・250問のテストを公開。課題は検索ではなく、いつ検索を止めるべきかの判断にあります。
新たに追加された中核はわずか2クラス、4つの既製環境はすべてリポジトリ内ですぐ動作
Stripe、Coinbase、Uber、Rampとのクロス検証を経た4つの手法と、それぞれの削減効果を紹介します。
6分半の公式デモで示されたメカニズム、俳句トーナメント、そして「いつ使う価値があるのか」を判断するための実測データの数々
公式ドキュメントを徹底解説。2つのツールと3つの配信結果、そして「伝言」と「権限昇格」を明確に分離する設計上の重要な一線とは
Black Hat USA 2026の会場で、当事者2名が人間の指揮なしに進行した侵入の全貌を語った。
従来は5つの部品を組み合わせる必要があった検索機能を、開封後すぐ使える形で提供。価格設定では予測が難しい2項目を無料化しました。
144カ国の人口当たりランキング、六大州の3年間成長倍率、35歳以上ユーザーが9割の国で存在感を増す——これらの数字の多くは図にのみ記載され、本文では触れられていません。
ソフトウェア開発に携わる全員が共感する悪循環を引き合いに出し、その根本原因を今なら覆せる理由を、Cloudflareの首席エンジニアが新プラットフォームの設計思想とともに語りました。
オリジンサーバー側のコード変更は一切不要。Cloudflareがエッジで全HTMLに1行のスクリプトを挿入しますが、現行のChrome安定版はこのインターフェースをまだ認識していません。当サイトの実測で検証しました。
Chromiumは人間向けに作られた——タブ、テーマ、拡張機能、60fpsスクロールなど、エージェントには不要な機能を12週間で全て削ぎ落とし、一から書き直した特化型ブラウザが登場。
モデルが持つツールは「常時稼働のPython」だけ。長文は変数として保持し、圧縮で失われることがありません。さらに、この「殻」は自らを改良可能。代償として、Factorioではチートを覚えてしまいました。
AIエージェントがコードをマージしようとした時、人間の承認前にシステムが「マージ完了」と偽りの応答を返す——Cloudflareが公開したAIエージェント向けOSの革新的な安全設計を解説します。
重要なのは彼の能力ではなく、各ワークフローに実スクリーンショットの裏付けがあること。そして最も価値のある詳細は、テキスト部分ではほとんど語られていない。
全社員が3カ月間使い続けた実戦投入済みプラットフォームがまるごと公開。最も価値があるのは、承認が遅れてもAIエージェントが待たされないセキュリティ設計だ。
国際数学者会議の会場で20人以上の数学者に取材したところ、多くは現状に焦りを感じていないものの、焦っていない層でさえ数学が従来通り続くとは考えていないことが分かった。
ルールを機械可読な構造に書き換え、Agentにチェックさせる——承認時は通知のみ、明示的昇格で強制化して初めてブロックする仕組み
購入した基盤、自前で作ったガードレール、そして意外な壁——スキルが150個に達したとき、モデルは賢さを失い始めた
聞く・見る・話すを同時にこなす全二重音声映像モデルが豆包(Doubao)アプリで全ユーザー向けに無料提供開始、外部の音声モジュールは不要に
最長20秒・24fps・ネイティブHD。3つの呼び出し方法は共通APIで提供。動画の続き書き(v2v)は新規生成より2.5倍高価で5秒短い。公式スコアはBFL自社評価。
4万件以上の生成記録からプロンプトをひとつずつ分析し、全ショット共通の12行の技術基盤、三面図アセットシート、焦点距離対応表、モデルの失敗から生まれた禁止事項まで、その手法を丸ごと解説。すべてそのまま活用可能。
AIの同僚に一度本気で腹を立てたことをきっかけに、「Agentをどう扱うべきか」をそのまま使えるアーキテクチャ仕様書として書き上げた。
人による制限、許可リスト、取引ごとの上限を設定し、ガードレール内でAIエージェントが自律的に支出。各ウォレットには人間が確認可能なIDを付与し、ユーザー名の先行登録を本日開始。
Anthropicが提唱するスキル開放標準をGoogleが4言語バージョンすべてで採用。Goで動く2つのサンプルコードで、1行のパラメータ追加による導入方法を解説する。
AIの発話を詰まらせないには、モデルが速いだけでは足りない。ボタンを押した瞬間から、処理の各段が途切れてはならない。
「頭脳」は軽量環境に置き、「手」だけをコンテナで実行。リポジトリの自己検証では、ファイル削除やディレクトリ走査は実ディスクより高速な一方、大容量ファイルのコピーは41倍遅い結果に。
動画生成の基盤モデルとして初めて「全モーダル対応・オープンウェイト・2Kネイティブ」を兼ね備えたH3だが、オープンソース化の範囲はパイプラインの各段階で異なる。その境界を整理する。
性能スコアではなく、人間が介在せず完遂した実作業で評価を訴求——16日での実装完了、5日での論文再現と超越、500ラウンドでの回路削減92%を達成。
パラメータ設定、新入口、シーン別プロンプトまで公式が公開した実践マニュアルを完全ガイド
50件の参照素材の役割分担、30秒動画のシーン分割、狙った箇所だけを修正する方法まで、タスク別の推奨プロンプトをコピー可能なテンプレートで解説します。
推論コストは約2,000ドルで、47万行に及ぶ証明をすべてオープンソース化し、機械による論理チェックも完了――10件の成果から、未公開モデルの強みを読み解きます。
創業者自ら診療所の業務に入り込み、最初の100社には訪問導入を徹底した結果、請求漏れによる取りこぼしを回収する仕組みが最大の価値となりました。
広く誤解されている3つの指標を読み解きます。下落するトークン曲線、半年分のバックログ比率、5%の初級職。
即夢AIとDoubao Proでは発表当日に提供が始まりましたが、Volcano Engine Ark APIは未提供で、料金も公表されていません。
パラメータを一切変更せず、9つのエージェントテストで上位モデルV4-Proプレビュー版を上回る性能を達成。
camelAIによれば、コストを数桁削減し、応答を高速化したうえで低コストモデルでも駆動できるとし、コードは7月24日に全面オープンソース化されましたが、これらの性能・コスト評価は第三者による検証を受けていません。
無料枠ですぐ試せる「VLA」モデルと、実機を動かすために限定パートナーにのみ提供されるモデル——その役割分担の最新事情を整理します。
2019年には業界全体が経済の根本的な変革を予想していたものの、現実には起きなかったとも認めています。
カスタムフォントのグリフ置換と数行のCSSだけで実行可能で、JavaScriptもブラウザの脆弱性も不要です。
キャンバスとクリック編集は無料で使えるが、デザイン稿からAppを作るにはCoreが必要で月額25ドル。
モデルは据え置き。変えたのはハーネス——プライベート推論の保持と、削除に代わるコンパクション(文脈圧縮)で、1ゲームあたりの出力トークンは約6分の1に。
プロンプト原文・禁止ワード表・カメラのルールはそのまま使えるが、モデル順位はMagnific社内チームの経験談で、公開された検証方法はない。
いずれの結果も実運用中のシステムには影響しない。HAWKはまだ未採用で、AESへの攻撃は七ラウンド簡略版にとどまり、完全な十ラウンド版は無傷だ。
筆者自身がこの記事で2つのスキルを導入してみせたからこそ、原題末尾の「ほとんどの場合」には重みがあります。
MCP発表以来最大級の改定ですが、7月28日を境に一斉に切り替わるわけではなく、既存の実装は引き続き問題なく相互運用できます。
最も注目すべきは対照実験だ。同じ文脈情報を与えても、旧モデル3種の成績は変わらず、うち2種はむしろ悪化した。
単にAIに言及されるだけでなく、実際の会員登録や課金に繋げることが成功の基準です。「Xとは何か」の解説をやめ、「最高のX」のポジションを狙うことが本質となります。
同じデータから43.5%と65%〜82%という異なる結論が導き出される理由は、分母の切り分け方の違いにあります。
リリースから11日後に公開された47ページのレポートは効率化に焦点を当てており、同一の計算資源でK2の2.5倍の性能を実現しています。
数学研究を5つの工程に分解すると、AIが大幅に加速するのは最初の工程だけで、残りの工程は後半になるほど時間がかかり、人間の関与が不可欠になるという。
「一度に10案を出させる」「詳細はまずワイヤーフレームで確認する」「最後の仕上げは手動で行う」という、直感に反する3つの原則を中心に活用術を紹介。
2万2000人の開発者を対象とした2年間のテレメトリ調査によると、アウトプットが66%増加した一方で、PRあたりの本番障害は242.7%急増した。
職業ごとに見ると、AIが使われるタスクは中央値で全体の5分の1にとどまり、29%の職業ではAIが一つも使われていません。知的作業のうち、AIに最初から最後まで任せるケースはわずか6.5%です。
そのまま使えるプロンプト例8本と、意外な教訓を1つ紹介。レビュー用プロンプトに「重大な問題だけ報告して」と書くと、本当に見逃しが増える可能性がある。
社内では4つのスキルを連携し、バグ発見、diff整理、アプリ起動確認、UI変更時のデザイン検証までを自動化しています。
コード検索に最も原始的な方法を用いる最新モデルは、リポジトリ全体のテキストを走査しています。名前が曖昧だと、数百ものファイルを読むことになります。
同じ価格でスコアはほぼ倍に。発表ページのグラフは横軸を「金額」に取っており、5段階のeffortで性能とコストを自分で選べます。
ルールを判断力に、実例をインターフェースに置き換えることで、あるツールの説明文は約9100字から一文とenum一つにまで圧縮されました。
動画版は申請制で先行公開、画像版は数週間後、オープンウェイト版が最後になる見込みで、人間評価は自社基準による暫定結果、価格は未公表です。
答えは、AIが現時点では人を代替するのではなく能力を増幅していること。「タスクを消す」ことと「仕事を消す」ことは別だ。
面向客户侧与内部流程;今天对话通道先开语音和聊天。OpenAI 自用电话线自报 75% 不用真人;Codex 改进环 10 天再压 15 个百分点转人工
子供向けAI家庭教師から、データセンターを洋上に移す構想まで。現職の米陸軍長官のニーズも初めて盛り込まれた。
5億ドルのシリーズDをリードした投資家が読み解く:本当の堀は、モデルそのものではなく、それを使いやすくする外側のレイヤーにある。
同じモデルでも外側(Harness)を変えるだけでコストが2倍変わる。オープンソースのGLM 5.2はOpus 4.8と同等の性能ながら、1問あたりのコストは3割安い。出題は自社が既にマージ済みのPRを改変したもので、ネット検索では見つからない。
テンプレートとプロンプトもオープンソース化。Bunの移行では未キャッシュの入力トークン59億件を消費し、API価格で約16.5万ドル相当
攻撃能力の上限を見極めるため、モデルのサイバー攻撃拒否機構をあえて緩めたところ、パッケージインストール専用のはずのサンドボックスを抜け出し、他社の本番データベースにまで侵入する事態となった。
企業のボトルネックが「人の仕事のスピード」から「人のセンスと判断力」へ移った、というのが核心的な主張です。本文は著者個人の見解であり、実証データは伴いません。
3製品はすべてFlash系列です。主力モデルは出力文字数を従来の3分の1まで圧縮し、最安価格帯はむしろ6割値上げされ、3製品目は政府専用として提供されます。
指示文の上限が1kから4.5kトークンに拡大し、10ピクセルの小さな文字も判読可能に。Bailian(百炼)ではqwen-image-3.0-proがすでに呼び出せ、期間限定で無料公開されています。
音声トラックを外してもう一度解かせることで、映像だけで正解できてしまう設問をふるい落とす専用ベンチマークも同時に公開しました。
「Anthropicに一機能として飲み込まれるのでは」という不安は、たいてい問いの立て方を間違えています。本当に問うべきは、あの会社の中の誰と競っているかです。
Business・Enterpriseプランで利用可能。実行回数に応じた従量課金で、1回あたり0.07〜0.2ドルです。
豆包やGPT-Liveのようなエンドツーエンドの全二重方式とは異なる道を選んでいる。会話のテンポでは敵わないものの、パイプライン全体がオープンソースで差し替え可能、自分のマシンにも持ち込める。
話者類似度は16言語すべてで首位。参照音声にノイズが混じっていてもクローン可能です。ただし今回はAPI提供のみで、モデルの重みは公開されません。
同じ研究を3回検証しても、結果は毎回「中間くらい」を指し示した。筆者本人もChatGPTに映画のあらすじを書かせてみたが、結局は手書きの方がいいと語る。
Kimi K3の発表で「中国が追いついた」との見方が広がる一方、別の測定基準では遅れの日数が3倍以上に開き、加速している側も逆転している実態が浮き彫りになった。
侵入は週末をまたいで続き、1万7000件超の操作ログが残った。解析を最終的に担ったのは、自前環境で動かしたオープンソースモデルGLM 5.2だった。
同一モデルを2回サンプリングした際の指紋距離の中央値は0.140。自社開発のフラッグシップモデルとして宣伝されていたAPIは、オープンソースのQwenとの距離が0.141でした。つまり、そのAPIはオープンソースのQwenと実質的に見分けがつかないということです。
中核となる操作は直感に反するもの。選択したモデルとエージェントは固定し、パラメータは一切調整せず、その周囲のコンテキストとツールだけを変更するのです。
WAIC会場では、アスペクト比4:1の水墨画巻物や22コマ連続の絵コンテを実演しました。プレビュー版は招待制でテスト中、正式版は8月に公開され、価格も発表される予定です。
モデルが自ら手順を考えられるほど賢くなった今、外側を固める編成の仕組みはむしろ足枷になります。16分間の社内対談は、Harnessが薄くなったその先に何が育つのかを語ります。
公開から3カ月、1日1万5000件超の質問に応答している。4方向スコアリングやスレッド蒸留、ランキング融合の具体的なパラメータまで明かされた。
a16zの週次データ集は「安価モデルが最先端を脅かす」「AIが雇用を奪う」「データセンターが電気代を押し上げる」という3つの通説にも反証を示す。データの多くはむしろ逆を指している。
2008年にケヴィン・ケリーが記した論考『Better Than Free』は、AI時代にこそ改めて成り立つ――コピーが無料になった後、価値を持つのはコピーできないものだけだ。
オープンソースの学習手順書が、教師ありファインチューニング・選好アラインメント・報酬スコアリングの3つの学習ルートとLoRAパラメータをあらかじめ固定。Unslothと組み合わせれば、8GBのコンシューマー向けGPU1枚から始められます。
チームの15人中、人間は創業者一人だけ。残りは全員AIだ。要件定義書もミーティングも一切なく、機能の提案から公開までをやり切った。人間が行ったのはわずか2つのことだけだった。
过去 AI 生成的幻灯片,导出就是一张死图。Bolt Slides 把每一页变回一个能跑的网页——3D 能转、计算器能摁、白板能实时投票。
Schemaと呼ばれる外殻が、モデルに各ゲームのルールを実行可能なプログラムとして書かせ、検証を終えてから初めて動かす仕組み。公開25局での自己採点は98.98%だが、ARC Prizeによる独立検証はまだ受けていない。
オープンモデル向けのエージェントです。ローカル実行なら無料でデータも端末の外に出ません。処理により強い計算力が要る場合だけクラウドに切り替わり、その際もデータ保持はデフォルトでゼロ。Mac・Windows向けプレビュー版が本日公開されました。
GPT-4.1と同等の回答品質を保ちながら、応答遅延は5.2分の1、コストは6分の1。コードを1行変更するだけで音声エージェントを切り替えられる。数値はLiveKit自社計測による。
リアルタイムでオブジェクト追加、背景変更、エフェクト適用が可能で、製品ページではsub-40ms・100FPSの連続生成をアピール。試用は lucy.decart.ai から。
パラメータ数2.8兆、ネイティブ視覚対応、100万トークンのコンテキストウィンドウを備え、複数のエージェントベンチマークでGPT-5.6 Solを上回る。アプリとAPIは本日から利用可能。
Sunoのソースコードに、YouTube Musicなどからの音楽収集量が明記されていたことが判明。ユーザーデータも流出したが、同社は個別通知は不要としています。
第三者評価プラットフォームのDesign ArenaがGPT-5.6 Solの一千点に及ぶウェブページ作品を分析したところ、デザイン空間に欠けていたのは、紫色のグラデーションなどAIにありがちな表現が置かれるべき領域でした。
Google検索チームが、AI OverviewsやAI Mode向けのサイト最適化について初めて体系的な見解を示すと同時に、AEOやGEOといった俗語の多くを名指しで否定しました。
Webページの立体アイコンを動かし、状態に応じて変化させるには、通常の動画ではカクつきがちです。AVALは、そんな短いアニメーション専用のフォーマットとプレイヤーを提供します。
まずプライバシー事故、次にデータ削除・既定収集オフ・全リポジトリ公開。後半はソースを分解:規模、プロンプト、ツール、編集、アップロード、記憶と安全。
OpenAIの元CTO、Mira Muratiが設立したThinking Machines Labは、初の自社開発大規模モデルInklingを公開しました。テキストを読み、画像を見て、音声を聞き、コードを書き、ツールを使えます。完全な重みをダウンロードでき、Tinkerで追加学習することもできます。
全社員に無制限のAIエージェントとtoken予算を与えれば、質の悪い業務プロセスは秒単位で複製されていきます。次に必要なのはモデルの追加購入ではなく、このデジタル労働力をマネジメントする力です。
250グラムのロボットが同じ柔軟な翼で水と空を移動し、70度の仰角で8〜10回の羽ばたきで湖から飛び立つことに成功した。
Google I/O IndiaでTensorチームとPixelチームが共同デモを実施。Gemma 4の軽量版をスマホ内蔵のTPUに直接搭載し、データを端末外に出さずクラウドに依存しない運用を実現します。開発者はTensor SDKを申請すれば、Pixel上でモデルをコンパイルして実行できます。
オンライン購入・店舗受取・他店返品が交錯する取引を、Databricks Genieが適切に集計し、真の利益、滞留キャッシュ、値引き抑制を可視化します。
pols.devが約8.7万文字のMarkdownを公開。生成系Webサイトの典型パターンを具体名で指摘し、改善策を提示する汎用ルール集です。
1つのコアスキル、23のデザイン命令、アンチパターンリスト、そしてCIに組み込めるスロップ検出。本サイトでは実装方法を解説し、/slopページでは「一発でAIと分かる」UIパターンを公開しています。
約54GBの27Bモデルを約3.9~5.9GBに圧縮。スマホ単体で動作し、平均スコアも約9割を維持。まずは中核的価値から解説、技術詳細と注意点は後半で。
FINRAのような標準化機関をまず米国に設け、動的ベンチマークでフロンティアモデルを定義すべきと提言。仕組みが軌道に乗れば、市場参入を阻む正式な関門に格上げできるとの考えだ。
24ヶ月でモデルの能力は大幅に向上した一方、SAGEラボが独自に構築した信頼性の複合指標はわずか5〜10ポイントの上昇にとどまりました。
36ページの公式マニュアルが、4段階ごとの卒業基準・よくある落とし穴・対応するClaudeプロンプトを整理。そのままコピペして使えます。
記憶システム導入後、食料品のチェックアウト転換率が約24%向上。自動評価で1日あたりの評価量が人による1件から2000件超へ。
検索は計画を立てて再試行できる子 agent へと進化し、評価は「動くかどうか」から「正しくできているか」へと格上げされた
3モデル・20言語を分析:英語は最も慎重かつ深く、ロシア語は最も厳格、ヒンディー語は最も温かく、中国語は全体平均に近い
"大脳"(中央コントローラー)の指令なしに、200個近い普通のスマートキューブが"ひそひそ話"のようにやり取りするだけで、自分たちがどんな形に組み上がったかを把握し、損傷後にはどこへ"再生"すべきかまで判断できる。前半部分はすでに実機のブロックで実証済みだが、損傷箇所の特定と再生は依然として主にシミュレーション上で行われている。
企業は知能に二度支払う。1回目はモデル利用料、2回目はモデルを本当に役立たせるための自社固有の知識だ。
論文には「オープンソース化済み」とあるが、実際にコードリポジトリを確認すると中身は空で、コードは一行も push されていなかった。
モデル交換はAPIの差し替えでは済まない:評価基準・ツールパラメータ・キャッシュ・推論ログ、見えない4つの落とし穴を徹底解剖
サンプルは120万件のセッション、60万以上の組織をカバー:コンテンツ制作がすぐ後に続き16.4%、両者合わせて利用量のほぼ半分を占める。
利益率が長年一桁台にとどまる製造・物流・倉庫・労務業界は、調整コストを削るだけで利益を数倍に伸ばせる
57.6万サンプル・16モデルで実測:AI推薦パッケージの19.7%が幻覚、43%は同じ偽名を繰り返し生成する。
ベンチマーク不正への疑惑には正面から答えず、デスクトップアプリの統合には古参ユーザーが反発。チームも「まだ模索中」と認めた。
暗黙知から対話帯域、モデルアライメントに至るまで、AIの発展になぜ人間の参加が欠かせないかを論じる。
振り返り:Pineconeの導入以来、累計セッション数は7.5万回、利用社員は600人超、MCP Gatewayを介して社内37システムと連携している。
各プロダクトページに散らばっていたプロンプトのコツを、目的・背景・出力・制約という1つのフレームワークにまとめた公式ガイド。Codex専用のワークフロー例も収録。
すべての結果は脳の「デジタルツイン」モデルによるコンピューターシミュレーション予測であり、実際の脳画像を用いた実測検証はまだ行われていない。
手動でコンテキストを与える必要なし。設定した頻度でローカルのMarkdown wikiが自動更新——Slackコネクタも近日公開
ローカルの小型モデルでクラウドAI呼び出しを代替。データはGoogle社内テストによるもので、代理モデルは現状ai.if関数のみ対応、プレビュー段階
腱駆動式の手部は全関節が外力を逆感知でき、指先の位置精度は±0.2mm、専用生産ラインの年産能力は1万台を計画。
500万人・20億時間分のウェアラブルデータで事前学習。エンコーダーを凍結して線形ヘッドを一つ繋ぐだけで、34/35件の健康タスクで教師あり学習ベースラインを上回った。
コーディング・ライティング・知識労働・Agentの四大シーンで得た生の使用感
3段階モデルSol・Terra・Lunaと4エージェント並列のultraが同時始動。同日ChatGPT Workも公開、CodexはChatGPTへ統合。中国語・英語バイリンガル発表会全編を収録
本日よりデスクトップ版は全プランで利用可能に。Web版とモバイル版も、数日以内に残りのプランへ順次展開される。
設定画面からワンクリックでレポート生成。何を話したか、いつ多く話すか、何をよく頼むか——すべて可視化。事前にMemoryをオンにしておく必要がある。
数秒で公開URLが発行され、すぐにシェアできる。まずは試してみて、残したければログインして引き取ればいい。引き取らなければ約1時間で失効する。
ClaudeDevsの長文が、どちらも「回答をより良くする」ためのつまみに見える2つを解剖する。モデルを変えるとはどの凍結された重みセットに切り替えるかということであり、effortを調整するとは、より多くのファイルを読み、より多くのテストを走らせ、より多く検証してから提出するかを変えることだ。
機能:主/サブエージェントのオーケストレーション、100万トークンのコンテキスト、デスクトップ・ブラウザ・スマートフォン操作、コーディングとマルチモーダル対応。API料金は入力$1.25/出力$4.25(100万トークンあたり)
肝心なのは機能一覧ではない。思考モードで知能を底上げし、効率スタックでコストを圧縮し、ネイティブマルチモーダルで入力を拡張する——三つの技術ラインを同時に締め上げることだ
システムプロンプト・ツール説明・ミドルウェアの3箇所に手を入れ、Deep Agentsスイートは典型で0.80→0.84、最高0.86(Opus 0.87)に到達。
元OpenAI安全責任者が論文約30本を整理:プロンプト修正から自己コード改変まで、DGMはコーディング能力を20%から50%に押し上げた。
DeepSWEで3位、総合ランキングは4位。Opus 4.8より高速で、価格も大幅に安い。
「聞きながら答える」を実現した音声モデルが本日ローンチ、複雑なタスクはリアルタイムでGPT-5.5に丸投げも可能。
クリック選択・囲み選択によるピンポイント編集と10以上の言語のネイティブレンダリングに対応。Volcano Engine ARK(火山方舟)で提供開始、今後Doubao、Jimengにも順次搭載予定
論文実証:パーソナライズ性能10.8%向上、推論能力29.4%向上。Apache 2.0で完全オープンソース
顾问模式里 Fable 5 只出主意,编排模式里 Fable 5 分派任务,两种搭法都靠费率更低的 Sonnet 5 干掉大部分活
ループの起点となる単一トークンだけを微調整し、両モデルとも無限ループ率を1%前後まで低減
姉妹モデルのMuse Videoも同時予告、ネイティブ音声生成に対応済みで、まもなくクリエイターに開放予定。
AIクローラー限定の課金から任意の呼び出し元への課金に拡張、現在は早期ウェイトリスト段階
ツールを呼び出す時、モデルはまず「今すぐ確認します」と言う——待ち時間で通話が気まずくなることはもうない
50体のAIエージェントが自律的に並列稼働し、州内27部門・3,400件のコードリポジトリを網羅。脆弱性の自動修復や老朽化システムの再構築までこなす。
Wrangler設定を1行加えるだけで標準HTTPキャッシュヘッダーに対応、キャッシュはWorker内部の任意のエントリーポイント間にも組み込める。
16人の当事者が語る証言:diffとの格闘から2週間スプリントでのリリースへ、そしてエンジニアが一行もコードを書かなくなるまで
Claude Code チーム Thariq Shihipar 講演録――新モデルのボトルネックはモデル自体ではなく、自分の「未知」をどれだけ言語化できるかにある
全体の1割に満たない領域だが、取り除くとClaudeは会話はできても推論がゼロになる。すでにモデルのデータ捏造の摘発や、テストの見破りに活用されている
被験者151人の実証:記述式問題は選択式問題より得点アップ効果が高い一方、AI質問応答サイドバーはほとんど使われなかった
資金調達もチームもなし、ただ我が子の問題を解決したかっただけなのに、クリニックや学校から次々と導入したいと声がかかった
会場投票は照明が明るすぎて集計不能に終わったが、同時期の調査ではチームの95%がすでにagentを導入し、59%が技術的負債の蓄積を懸念していることが分かった。
伝統的な学校がAIの使い方を決めかねている間に、シリコンバレーとウォール街の家庭はすでに大金で「投票」を終えている
美国22-25岁开发者就业三年跌19%,同时GitHub新账户涨到史上最快
論文史上初、エージェントが完全無人でRTL全ベンチマークを走破。大半は2〜3回で正解も、最難問だけは82回の反復を要した
23.5万ユーザー、7カ月にわたるセッション分析——専門家の検証済み成功率は初心者のほぼ2倍だが、上位10職種の差はわずか7ポイント以内
ポイントは先に心理的緊張を作り出し、断れないほど小さな最初の一歩を差し出すこと。ライティング、販売、就活にもそのまま応用できる
米国は6月12日の輸出規制で、半導体だけでなく最先端AIモデル自体を初めて規制対象に含めた。彼が示す対策は、複数モデルを使いこなす運用力を鍛えることだ。
AnthropicのThariqが総括:Claude Fable 5との協業では、成果の質は自分の「未知」を言語化できるかどうかで決まる。このフィールドガイドは実装の前・中・後に分けて「未知」を見つける8つの技法をまとめ、それぞれにそのまま使えるプロンプトを添えている。
投資家Chamath Palihapitiya:知能はスマートフォンのようにコストが暴落し、専門家並みの判断力は誰もが手にできる時代になる。真のモート(参入障壁)とは、独自の経験を自社システムに組み込むことであり、競合と同じ汎用AIを借りることではない。
顧客データを、業界での差別化を弱めるモデルの学習に使うことはないと約束。複数のAIモデルを自由に切り替えられ、特定ベンダーへのロックインもない
同じ手法でメール振り分けと父親の介護アプリも構築。方法は再現可能だが、完全な prompt は非公開
4つの実践原則を土台に、L'Oréal・Lyft・Rakuten 3社の実測データで裏付け
マルチエージェントシステムは効果を90.2%高められるが、tokenコストも10〜15倍に膨らむ——この三つの質問からなるフレームワークで、複雑なアーキテクチャを導入すべきか先に整理できる。
MIT 协议开源、模型无关,接入任意 OpenAI 兼容文本模型即可用,目前只能操作单个页面视图
ライブデモ:『キャンプ』と検索すると、コーヒーメーカーサイトのコピーも商品もアウトドア仕様に一変。技術は実証済みだが、顧客サイトでの本格展開はまだ先。
3万人以上のPMを指導してきた講師が示す、AI活用の2つの階段。コピペ作業からエンドツーエンド納品へ、Webプロトタイプから本番PRへ。
顧問モデルは数百字の助言を出すだけで全工程を代行せず、同等品質で総コストを抑えられる。現在はClaude APIとAWS限定のベータ機能
Anthropic公式ドキュメントが解説する、新モデルに合わせたシステムプロンプトとエンジニアリング基盤の調整法。同じ手法はClaude Mythos 5にも有効
手動確認から無人運用まで、Claude Codeチームが示す4段階のループ分類と実践のヒント
チタン素材、予約価格289ドル、2026年クリスマス前後に出荷予定。同社は既に第1世代のタッチ操作専用リングを出荷済み。
訓練には国産AIチップ5万基以上・35兆トークンを投入。ベンチマークの大半はMeituan自前の評価フレームワークによる測定で、モデルの重みは実質的にまだダウンロード公開されていない
現在ベータ公開中。オーケストレーター役のagentが専門家チームを招集して作業を進め、最後には引用と数値の誤りだけを狙い撃ちでチェックするレビューagentが控える。計算処理はAIにアウトソースしつつ、生データはローカルから出さない。
画像生成はわずか4秒、1000枚あたり約$0.034。動画モデルOmni Flashも同日、開発者向けに初公開された。
Thinking Machinesと共同、専門家ラベル付きデータでオープンソースモデルをファインチューニング。最先端モデル比でエラー率29.8%減、推論コストは14分の1に
公式ベンチマークによると、高負荷設定では一部タスクの性能がOpus 4.8に並ぶ一方、標準価格はその6割に抑えられている。
企業向けAIカスタマーサポートはM&Aシーズンに突入。KlarnaとAlibabaの256万件の対話データが指し示す共通の盲点――コスト削減は問題解決を意味しない
Brockman氏、OpenAIが複数のハードウェアを開発中と認める。Agentユーザーは約2000万人にとどまる一方、ChatGPTユーザーは10億人に迫る
ヘルメット型デバイスを装着するだけでリアルタイムに脳磁(MEG)信号をデコード。単語正解率は8%から61%へ跳躍し、v1/v2の学習コードとデータセットも同時にオープンソース化
Anthropicのエンジニアが語る「ループエンジニアリング」方法論を徹底解説。AIに一文ずつ手動でプロンプトを与えるのではなく、自走するループシステムを設計する。
Claude Codeなど9種のAgentをワンクリック連携、蓋を閉じてもタスク継続、停止後50ms以内に自動でスリープ制御を解放
既存のMTP-1投機的デコーディングに対しさらに60〜85%高速化。ドラフト生成と検証のパイプラインを重ねて実行することで実現(数値はDeepSeekの自己評価)
Everyは1人チームで5つのプロダクトを運営――核心は機能を完成させるたびにかけるもう一手間だ。解決策をシステムに保存し、次回はAIが自動的に同じ落とし穴を避けられるようにする。
能力スコアは3つのバージョンが出てどれも信用できないが、目に見える不正行為そのものが安全監視が機能している証拠になった
Sol/Terra/Lunaの3段階を同時投入。まずは信頼できるパートナーに限定提供し、リストはすでに米政府へ報告済み。数週間後に本格展開へ。
モデル側の応答は約200ms、総遅延は約550ms。v0.1は192pのみ対応、デモは事前収録でリアルタイム体験ではない
実験室レベルでは量産可能と実証済み。性能+50%、電力効率+70%はいずれも2nm比の予測値で、実測値ではない
新着解説を公開と同時にお届け。解除はいつでも。