Загрузка видео...

Не удалось загрузить видео

На главную

CodexのChrome拡張機能で、複数サイトをまたいだリサーチ、Excel・PPTXの作成まで実行しました。 AIが自律的にタスクを進める過程はこちら↓

17,608 просмотров • 3 месяцев назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

PFNから、材料科学などのシミュレーションを用いた長期の解析タスクを実行できるコーディングエージェント PARC を発表しました。末尾に実行動画、スレッドに論文があります。 PARCは100ステップを超えるような研究計画・実行・検証・考察を行い、数十時間規模のシミュレーションを複数同時に走らせ、結果を自動で検証します。 PARCはマルチエージェント構成であり、プランナーと複数のワーカーからなります。まずプランナーが実行計画を立て、人の承認を受けた後、自動実行に移ります。自動実行は複数のステップに分割され、各ステップ内では自己検証と、外部エージェントによる検証と修正によって途中実行結果を何重にも検証しながら進めていきます。 LLM自体の性能向上がある中でも、現時点ではこうしたマルチエージェントシステムは必須で、それを使わない場合は今回のような長期タスクは不可能dした(今回のケーススタディはClaude Sonnet 4.5で行っています)。 ケーススタディでは、論文などで報告されているシミュレーションを使った解析を再現できるかを調べ、それを専門家が検証する形でその有効性や課題を調べました。 具体的には、固体電解質におけるリチウム拡散の推定、超合金の偏析機構の解析、電場をかけた非平衡シミュレーション、および汎用性を確かめるため同じシステムでのKaggleタスク実行を行いました。これらではシミュレーションの実験設定が誤っている場合でも、PARCが自動で検証し間違いを発見できることを確認しました。 一方、電場をかけた非平衡シミュレーションの場合は、途中の重要な計算に誤りがあり、誤った最終結果が導かれることが判明しました。ただし、このときも研究者がその部分だけを修正すれば全体は正しく動作することも確認しました。このようにPARCは中間計算や実行結果を逐次レポートするため、研究者が正確に介入できる点も大きな利点です。 今後も全体の最適化をAIがしつつ人が適切に介入できるシステム設計が重要になると考えられます。

Daisuke Okanohara / 岡野原 大輔

32,988 просмотров • 8 месяцев назад

「Sakana Marlin(サカナ・マーリン)」は、数時間に及ぶ長期の自律推論を特徴としたビジネス向けの自律型リサーチアシスタントです。 調査テーマを指示するだけで、最大約8時間にわたって自律的にリサーチを進め、構造化されたサマリースライドと数十ページの調査レポートを生成します。 CSO(Chief Strategy Officer)が数人のチームと数週間かけて行うような戦略調査を、AIが担うことを目指して設計しました。ユーザーが行うのは、最初のテーマ設定だけです。あとは Sakana Marlinが仮説の立案・情報収集・検証を自律的に繰り返しながら、膨大な情報の中から論点を掘り下げていきます。 その土台にあるのは、Sakana AIがこれまで研究してきた長期推論や、複数のモデルを協調させて推論能力を高めるAB-MCTSといった技術です。同時に Sakana Marlinは、机上の研究だけでなく、国内の各産業でAIエージェントを実装してきた事業開発の現場から生まれたプロダクトでもあります。研究と実務の両方で培ってきたものが、ひとつのプロダクトになりました。 セルフサーブで即日ご利用いただけます。月額無料のPay per useから、Pro・Team・Enterpriseまでのプランをご用意しています。 Sakana Marlinを皮切りに、Sakana AIは今後も、様々なプロダクトをリリースしていきます。 詳細はこちら:

Sakana AI

47,399 просмотров • 2 месяцев назад

【速報】 は????? 今日の『Codexアプリ』のアップデートで、 Codex + Computer Useのワークフロー実行速度が 『『『『42%高速化』』』』した、、、 これ革命すぎる。意味がわからない。 ついにブラウザ操作が“人間の操作速度”に近づいた。 つまりどういうことか?👇 ・完全なアプリを構築する ・ブラウザ上でユーザーフローを検証する ・画面を見ながら自律的にクリックして進む ・バグを発見する ・そのまま修正する ・コンソールログを読む ・ネットワークログまで確認する ・タスク完了まで自分で反復する つまり、 「コードを書く」 ↓ 「ブラウザで試す」 ↓ 「エラーを見る」 ↓ 「直す」 ↓ 「もう一度試す」 この一連の開発フローを、Codexが自律的に回し始めている。 これが本当に大きい。 てかこれ、エンジニアだけの話じゃない。 マジで全ビジネスパーソンに関係ある。 ・営業資料の作成、 ・LP改善、 ・広告運用の確認、 ・競合リサーチ、 ・フォーム入力、 ・管理画面の操作、 ・データ確認、 ・業務フローの検証。 こういう“ブラウザで完結する仕事”が、 どんどんAIに置き換わっていく可能性がある。 今までのAIは、 「文章を書く」 「コードを書く」 「アイデアを出す」 が中心だった。 でもComputer Useが入ると、 AIが実際に画面を見て、 クリックして、 確認して、 修正して、 最後までやり切る方向に進む。 これはかなり大きい。 Claude Codeだけ追っていた人も、 Codexの進化は絶対に見ておいた方がいい。 なぜならこれは、 “AIがコードを書く時代”から、 “AIがPC上の仕事を実行する時代”への移行だから。 で、まだCodexの波についていけてない初心者🔰はこの下の記事を絶対に読んで!!!! これ1本でCodexへの理解が一気に深まる。 マジでおすすめ👇

Codex Studio

243,774 просмотров • 4 месяцев назад