初心者向けわかりやすいOpenClaw学習ガイド。

AIについてのガイドとコンテンツ、その実装例が豊富なチャンネル: https://t.me/claudedevolper

OpenClawをインストールしました。この技術はロシア語圏とグローバルなインターネット全体を揺るがすほどのインパクトをもたらしました。数週間で、AI専門家、ブロガー、開発者から、OpenClawベースの個人用AIアシスタントをセットアップする方法を詳しく説明する膨大な数の動画が登場しました。私自身も2週間積極的に使用しており、実際の経験を正直にシェアすることにしました。詳細なビデオ分析を記録し、OpenClaw使用に関する最も重要な実践的側面について説明するこの記事を編集しました。ここで明確にしたいのですが:「これがすべてを変える」、「チーム全体をクビにした」、「エージェントが今は私の代わりに働いている」といった大げさなステートメントはありません。ただドライな事実、実際のケーススタディ、具体的な価値のみ。ハイプやマーケティングノイズなしです。退屈かもしれませんが、実質的です。

OpenClawの技術的特徴:エージェントが実際にどのように機能するか

OpenClawにまだ精通していない場合は、以下に簡潔な歴史的背景と、このAIエージェントの技術的本質を説明します。現代のAIエージェントがどのように構成されているかについては、別の記事とビデオで既に詳しく説明しています。ここでは、あなたが動作原理を理解するための最も重要なポイントのみ説明します。すべての基礎はLLM(大規模言語モデル)です。本質的に、これは「テキスト→テキスト」という単純なメカニズムです。入力はテキストで、出力もテキストです。すべての魔法は、モデルがリクエストを「理解」し、意味のある答えを提供するという事実にあります。その後、重要なブレークスルーが現れました。tools(ツール)メカニズムです。今、テキストリクエストと一緒に、モデルは呼び出すことができる利用可能なコマンド(関数)のリストを受け取ります。例えば、LLMに「カレンダーにリマインダーを設定する」というツールがあることを伝えます。その動作には、イベント名と日時の2つのパラメータが必要です。ユーザーが「明日の午前10時にクライアントとの会議についてのリマインダーを設定して」と書くと、モデルはリクエストを分析し、これがツール用のタスクであることを理解し、特別なJSON命令を形成します。システムはこの命令を受け取り、現実世界で実行し(カレンダーにイベントを追加)、結果をLLMに返します。その後、モデルは通常のテキストでユーザーに「リマインダーは明日の午前10:00に正常に設定されました」と答えます。

OpenClawが従来のエージェント作成スキームをどのように破壊するか

長い間、AIエージェントは同じスキームに従って構築されていました。事前にツール(tools)のリストを準備し、それをモデルに渡して、どれを呼び出すか選択させるのです。そのようなエージェントが安定して機能するようにするには、すべてのツールを記述、接続、テスト、デバッグする必要があります。これは伝統的に開発者によって行われていました。CursorやClaude Codeのような最新のアシスタントでも、このプロセスには時間と技術スキルが必要です。OpenClawはこのパラダイムを完全に変えます。

システム内に、「新しいツールを自分に追加する」と呼べるメタツールが現れます。以前は人間が行っていたすべてのこと(コードの記述、関数の接続、設定の修正、サービスの再開始)は、今エージェント自身が実行できます。

シナリオは次のようになります:

ユーザーが新機能のリクエストを定式化します。
エージェントは自分のドキュメントを開きます。
どのような変更が必要かを分析します。
PythonまたはTypeScriptで新しいツールを生成します。
独立して設定ファイルに記入します。
自身を再構築して再起動します。

以前は、これは開発者の関与を伴う複数のステップを必要としました。今、大部分の作業は自動的に行われます。現代のモデルは既に十分に賢いです。ほとんどの場合、最初から機能するツールを作成し、すぐに使用できます。何か問題が発生した場合、エージェントには組み込みのロールバックメカニズムがあります。前のバージョンのコードまたは設定に戻り、もう一度試すことができます。もちろん、これはブランチとプルリクエストを備えた完全なGitではありませんが、障害後、OpenClawは独立して立ち上がり、作業を続けることができます。最終的に、ユーザーは単に「これを実行できるようにしてくれ」と言うだけです。その後、エージェント自身が:

  • ドキュメントを研究し、
  • 必要な機能を追加し、
  • 更新されたバージョンで再起動します。

新しいツールにAPIキー、アクセストークン、またはその他のパラメータなどの追加データが必要な場合、OpenClawはユーザーに要求します。その後、すべてのシークレットは個別の保護された環境変数と設定に保存されます。それらは通常のログに入ることはなく、チャットに表示されません。システムは最初から最大限の注意を払って機密データを処理します。OpenClawの周りのハイプOpenClawはすぐに有名な開発者やブロガーに到達しました。雪崩効果が始まりました:GitHubのスター数は急上昇し、動画とレビューが次々と降り注ぎました。

なぜOpenClawの周りのハイプが私に懐疑心を起こさせるのか

その後、ジャンルの古典が続きました:オンラインコース、「世界は二度と同じにはならない」や「ゲームのルールを書き直している」といった大げさな見出しです。しばらくの間、すべてのソーシャルメディアフィードに、別のブロガーやAI専門家が、部門全体を解雇し、それを1つのエージェントで置き換え、現在「パッシブインカムと自由」モードで生活していることを説明する動画がありました。

未来がやってきた、それ以外にない!(スポイラー:違います。)

人々がWarcraftスタイルの「エージェントオフィス」全体を組み立てているのを観察しています。視覚的には非常に効果的に見えますが、実際の作業では必ずしも明確な価値をもたらしません。私の内面的なITスケプティックは、メタバースの話を思い出します:同じ大げさなハイプ、美しいデモ、そして1年後には全く同じ失望です。

なぜ私はそれでもハイプにもかかわらずOpenClawを試してみることにしたのか

通常、私は大げさな技術的ハイプを避けるようにしています。しかし、私は常に新しいツールに注意深く従っています。時々、騒ぎの後ろに実際に機能する何かが隠れています。OpenClawでも全く同じことが起こりました:実際の作業に導入してみると、特定のタスクでは実際に明確な価値をもたらすことに気づきました。

OpenClawのインストール:2つのパス(危険と安全)

OpenClawは2つの基本的に異なる方法でインストールできます。

1. 危険な方法 — ワンコマンドでのローカルインストール ドキュメントでは、OpenClawをお使いのシステムに直接「インストール」する既成のスクリプトを実行することを提案しています。スクリプトはすべてを自動的に行います:

  • Node.jsを必要なバージョンにダウンロードおよび更新します
  • OpenClaw自体をインストールします
  • システムサービスとして設定します
  • すべての依存関係と環境をプルします

その結果、エージェントはすぐにお使いのコンピューターでバックグラウンドで動作し始めます。

このアプローチの利点は明らかです。
OpenClawはファイルシステムへの完全なアクセスを取得します。「最新の顧客契約書を探して、詳細を更新して新しいバージョンを保存してください」のようなタスクを与えることができます。エージェントはファイルを見つけ、開き、編集を行い、結果を返します。さらに、ブラウザと直接連携できます。Webサイトを開き、フォームに入力し、データを収集します。チケット販売サイトにアクセスし、ルートを選択し、スケジュールを確認して、既成のオプションを提供するエージェントのデモを見ました。

実質的には、これはほぼ同じ「Jarvis」です — あなたの作業環境と実際に相互作用するアシスタントです。

しかし、深刻なリスクもあります。
まず、データ漏洩の可能性があります。

決定を下すために、エージェントは定期的に大規模なコンテキストをLLMに送信します。ファイルの内容、開いているタブ、システムの状態です。この情報の一部はモデルサーバーに送信される可能性があります。

次に、危険なアクション。モデルはエラーが発生したり、「幻覚を見たり」タスクを誤解したりする可能性があります。エージェントがシステムへの完全なアクセス権を持っている場合、重要なファイルまたは設定を誤って変更する可能性があります。モデルが独自の設定を単に破損した実例を見てきました。JSONを修正する必要がありました — コンマを忘れて、ファイルが読み込めなくなり、システム全体がダウンしました。開発者にとって、これは5分の修理です。通常のユーザーにとって、これは完全な停止と、次に何をするかの完全な理解不能です。その結果、ITの経歴を持つ人だけが対処できるOpenClawの「墓地」が現れます。

2. セキュアな方法 — 分離された環境 私はこのオプションを選択し、エージェントをメインのワークマシンから最大限に分離しました。現在、それは会社のデータセンター内の別の仮想マシン(VPS)です。それには純粋なUbuntuがあり、OpenClawがインストールされ、他にはほぼ何もありません。エージェントが何かを壊した場合、この仮想マシンだけが影響を受けます。メインサーバーへのSSHアクセスはありません。

将来的には、別のノートパソコンを割り当てる予定です。独自のユーザー、独自のブラウザ、独自のアカウント、そして私が特別に許可したサービスへのアクセスのみです。実質的には — エージェントのための完全な「ワークスペース」です。このアプローチはすぐに主な問題を解決します:

  • セキュリティ。メインコンピューターには、クライアントデータ、本番サーバーへのアクセス、その他の機密情報が保存されています。外部APIを通じて決定を下すモデルの管理下にこれを置く準備ができていません。
  • 制御。エージェントがサイトを見る必要がある場合、マシンに接続してページを手動で開くことができます — 時々より速く、より信頼できます。
  • 最小限の障害の影響。最悪の場合、仮想マシンを削除して、数分で新しいものを作成するだけです。

OpenClawの実際のコスト

今、ほぼすべてのブロガーが沈黙しているで最も重要なことです。

OpenClawはLLM推論によって動作し、これはかなり高価です。「部門全体を解雇して1人のエージェントに置き換えた」についてのすべての話は、トークンの費用の問題をうまく回避しています。これは20世紀初頭に「私はもう歩いていません、自動車で移動しています」と言うようなものです。ガソリン代やメンテナンスについては何も言いません。

リクエストの実際のログを調べて、いくつかの明確な例を収集しました:


例 入力 出力 キャッシュ 価格

セッションをリセット 10 668 37 1 408 ~1.5 ₽

リマインダー 45 300 522 16 100 5–7 ₽

コーダータスク 263 000 6 000 168 704 50–60 ₽


OpenClawが実際の作業でこんなに高価である理由

通常のチャットで「こんにちは、元気ですか」と書くと、数十トークンだけです。エージェントではすべてが異なります。各リクエストは、巨大なシステムコンテキストと共に送信されます。エージェントの動作に関する詳細な指示、パラメータの説明を含むツールの完全なリスト、現在のメモリ、会話の履歴、およびサービスルールです。合計すると、各リクエストで数万トークンになります。したがって、「リマインダーを設定して」というシンプルなコマンドでさえ、完全な内部ダイアログになります。

ワークフローは次のようになります:

  • エージェントはモデルにリクエストを送信します:「次に何をする必要がありますか?」
  • モデルはタスクを分析し、ツール付きのJSONコマンドを返します。
  • システムはアクションを実行し、モデルに再度照会します:「これを実行しました。ユーザーに何と返すべきですか?」

各ステップはLLMへの個別のリクエストです。結果として、小さな操作でも数万トークンを簡単に消費します。実際のログから:

  • シンプルな「リセット」セッション — 入力コンテキストだけで約10,000トークン。
  • 通常のタスク「1時間後にリマインダーを設定」— 40〜50,000トークン。エージェントはドキュメントを複数回チェックして応答を形成するため。

タスクがより複雑な場合(コードを書く、プロジェクトを編集する、新しいページを作成する)、消費は1回の操作で数十万トークンに簡単に及びます。積極的に仕事をしているときは、1時間で簡単に2,000~3,000ルーブルが消費されます。1日で数万ルーブル。初期設定と実験は特に高くつきます。もう1つの隠れた費用があります — cron/heartbeat。エージェントはスケジュールに従って起動し、バックグラウンドタスクを実行し、あなたが何も書いていなくてもトークンを消費する可能性があります。Redditでは、自動化してOpenClawを1日放置した人たちの話があります — そして1日で5,000~7,000ルーブルの請求を受けました。

ハイプの価格対実際の経済

ここで、「私は部全体をリストラし、今は1つのエージェントが私の代わりに働いている」という美しいストーリーの数学は、現実のコンクリートに砕けます。エージェントが少なくとも1時間ぶっ通しで作業する場合、これは既に簡単に10,000~20,000ルーブルです。1ヶ月で金額は100万ルーブルに近づく可能性があります。したがって、従業員の完全な置き換えに関するすべてのストーリーは、経済を見ると崩れ落ちます。エージェントは確かに個別の機能やルーチンタスクをクローズできます。しかし人間を完全に置き換えることができるのは、その仕事全体が元々非効率だった場合のみです。

プロバイダーのサブスクリプション:より安く、より予測可能

「従量課金」モデルでトークンに対してお金を払うことは、常に突然大きな請求を受けるリスクです。エージェントが積極的に作業している場合、カウンターは非常に高速に回転します:1回の操作で数万トークン、その後別のステップ、さらに別の。ある時点で、あなたはただ発見します — 2、3時間の実験で数千ルーブルを費やしたことを。この意味では、サブスクリプションは保険として機能します。あなたは明確な制限があり、1日または数時間でシステムをどのくらい使用できるかおおよそ知っています。そして予期しない巨額の請求を受けるリスク — 1つの失敗したエージェント実験のため — はありません。

OpenClawの使用におけるClaude ProおよびAnthropicサブスクリプションの実際の制限

コミュニティでの議論を観察すると、私は明確な意見を形成しました:安いサブスクリプションは非常に速く終わります。最も人気のあるオプション — 基本的なClaude Proサブスクリプションを取りましょう。通常、エージェントとの1時間のアクティブなダイアログで十分です。その後、制限に達し、リセットを待つことを余儀なくされます — 時には数時間。これが正にOpenClawでの真摯な作業のためにほとんどのユーザーがより高い料金体系に移行する理由です。Anthropicには、継続的な制限なく実際に動作できるプランがあります — これは月額約$200の料金体系です。彼らはすでに実用的なトークンボリュームを提供し、エージェントの完全な使用に十分です。しかし価格はかなり高くなっています。一方、Anthropicはかなり厳格なポリシーを持っています:会社は彼らのサブスクリプションが公式インターフェースを通さずに、OpenClawのようなサードパーティのエージェントフレームワークとシステムを通じて使用されるのをあまり好みません。そのような場合、アカウントは予告なしにバンされることがあります。

Redditの投稿 Claude Codeアカウントのバンについて

OpenClawはそもそも何が必要ですか?

ビデオとレビューではOpenClawは最も頻繁に「魔法の杖」として表示されます:エージェントを配置した — そして彼は今、自分自身のコードを書き、顧客に対応し、タスクを管理し、生きている従業員を完全に置き換えます。あなたが24/7の完全なデジタル同僚を手に入れたように見えます。私の見方はずっとより地に足がついています。OpenClawを人間に代わるものとしてではなく、むしろ手の延長として見なします — 私がすでにできることを加速するツール。これは同じAIの進化であり、ただし、今はそれを迅速に微調整して改善できます。それは魔法をしないし、私の脳を置き換えない。ただ日常を取り除くだけです。基本的にはこれが優れたターミナル、IDE、またはbashのオートコンプリート後の次のレベルです。かつて、bash-autocompleteionとWebStormがこのような加速器になりました — 彼らは些細なことで大量の時間を節約しました。以前は、プロジェクトに変更を加えるには、リポジトリを開き、ファイルを見つけ、コードを修正し、マージリクエストを作成する必要がありました。現在、このチェーンの一部はエージェントが引き継ぐことができます。しかし、最終的な決定、結果の確認、責任は自分に残します。これが正に私がOpenClawを「自律的な労働者」としてではなく、むしろ特定のタスクで賢い助手として実装する理由です — 彼が実際に時間を節約するところで、何かを壊すリスクを生まない。以下、実際の例について説明します。彼がすでに自分自身を有用であることを示したところです。

Telegramの音声メッセージを介したコーダーエージェント

自分で設定した最も実用的なケースの1つは、Telegramを介した音声メッセージ付きのコーダーエージェントです。今日のコーダーエージェントはもはや誰も驚かせません(私は以前、私たちが会社でそれらをどのように使用しているかについて話しました)。しかし、毎日「ライフラッグ」を手に入れたいと思いました:コンピュータの前に座っていなくても — 車で、散歩中、または旅行中 — プロジェクトにすばやく変更を加える機能。

Telegramで作動するOpenClawコーダーエージェント

Telegram専用に別の特殊なエージェントを設定しました。通常のテキストと音声メッセージの両方でコミュニケーションできます。彼ができることは:

  • 音声メッセージを受け入れる
  • それらをテキストに転写する(またはテキストリクエストで直接動作する)
  • タスクを理解する
  • プロジェクトのコードに変更を加える
  • マージリクエストを作成する
  • MRへの直接リンクを送信する

その間、エージェントに厳しい制限があります:彼は本番環境にアクセスできず、自動デプロイメントを行うことはできません。最終的なアクションは常に私の手に残ります。実際のプロセスはどのように見えるか:

  1. 修正を加えるよう求める音声またはテキストメッセージを送信します。
  2. エージェントは必要なリポジトリを見つけ、コードを分析して変更を加えます。
  3. マージリクエストを作成して私に割り当てます。
  4. MRへのリンクを送信します。
  5. MRを開いて変更をレビューし、通常の開発者と同じようにコメントを残します。
  6. 必要に応じて、エージェントに指摘を修正するように言います。
  7. 彼は修正を加えてMRを更新します。
  8. すべて問題がないとき、私は自分で変更をマージします。

基本的に、エージェントは若手開発者のように機能します。地道な作業をすべて行いますが、最終的なコントロール、検証、責任はすべて私に残ります。このツールは何度も本当に私を助けてくれました。実例
ある時、サイトの価格が「狂った」ことがありました。60ルーブルの代わりに60,000と表示され始めました。私はコンピュータの前にいなかったので、電話で修正しようとしました。その結果、意図せずサービスを壊してしまい、ロールバックするまでダウンしていました。コンピュータからなら2分で修正できたはずです。でも電話からはIDEも適切なプロジェクトアクセスもなく、本当に辛いものでした。そんな時に救ってくれるのが、OpenClawという音声コーディングエージェントです。メッセージを音声で指示すると、彼が修正を加え、MRを作成し、私は電話から変更を落ち着いて確認してマージできました。パニックも長時間のダウンタイムもありませんでした。

OpenClawコーディングエージェントの設定方法

以下、具体的にどのようにしたかについて簡潔に説明します。興味深い点は、このツール自体の設定プロセスの大部分がこのエージェント自身との通信を通じて行われたことです。つまり、新しい機能を文字通りダイアログで追加していったわけです。ステップ1. 開発用の別々のチャットを作成する

まず、開発専用のチャットを作成するようエージェントに依頼しました。考え方は単純です。エージェントとの通常の会話がコーディングタスクと混ざらないようにするためです。

大体こんなことを書きました。開発者とクライアントのように協力できる別々のチャットが欲しい、と。彼は、チャットを作成して、そこに追加して、テストメッセージを送る必要があると言いました。

最初は主要チャンネルgeneralに書き始めたのですが、ボットが何も応答しないことに驚きました。後で気づいたのは、OpenClawはグループチャットではデフォルトで@mentionで指定されたときだけ反応するということです。その後、うまく動作するようになりました。

問題は、ボットが自信を持って原因を説明しているのですが、私はTelegramボット開発の豊富な経験があり、これが明らかに私がどこかに間違って書いたことが原因ではないことを理解しています。ボットは根本原因については言及していません。実は、ボットは最初からボットのユーザー名をメンション(@mention)することで機能するように設定されているんです。

ステップ2. システムプロンプトを設定する

次に、このチャットに別々のシステムプロンプトを紐付けました。その中でエージェントの役割を説明しました。

  • 開発者として機能する;
  • 特定のプロジェクトのみで作業する;
  • マージリクエストを通じて変更を加える;
  • 本番環境へのアクセス権がない。

これは重要です。このような制限がなければ、エージェントが予期しない行動を始める可能性があります。

システムプロンプトの設定はopenclaw.jsonファイルで行われます。以下は、channels.telegram.accounts.amorevbot.groupsパスにある私の設定ブロックです。

"groups": {  "*": { "requireMention": true },  "-123123123123 (ид чата)": {    "requireMention": false,    "groupPolicy": "allowlist",    "enabled": true,    "topics": {      "23": {        "requireMention": false,        "enabled": true,        "systemPrompt": "Ты отдельный агент для проекта ai-provider. Всегда работай в репозитории /home/ubuntu/.openclaw/workspace-amorevbot/ai-rpovider. Все указания по работе с проектом читай тут /home/ubuntu/.openclaw/workspace-amorevbot/projects/markus-coding/ai-provider/AI_RULES.md и всегда следуй этим правилам!"      }    }  }}

ステップ3. リポジトリへのアクセス権を付与する

次のステップはGitへのアクセスです。

エージェント用に、GitLabに専用ユーザーを作成しました。これもセキュリティの問題です。何かうまくいかなくなった場合、このアカウントを簡単に無効にできます。

その後、私は以下のことを行いました。

  • SSHキーを作成した;
  • GitLabに追加した;
  • エージェントにアクセストークンを付与した。

この後、エージェントはリポジトリをクローンし、ブランチを作成し、変更をプッシュすることができるようになりました。

ステップ 4. 最初のテストリクエスト

設定後、最初のシンプルなタスクを与えました。

エージェント:

  1. リポジトリをダウンロード;
  2. プロジェクト構造を分析;
  3. 必要なファイルを追加;
  4. コミットを実行;
  5. マージリクエストを作成。

数分後には、既にマージリクエストへのリンクが届いていました。

ステップ 5. 通常のコードレビュー経由での作業

その後のプロセスは、通常の開発者と全く同じです。MRを開いて変更を確認し、コメントを書きます:

  • ここを修正して;
  • ここが間違ったファイル;
  • ここは別のやり方がいい。

エージェントはコメントを読み、変更を加えてMRを更新します。これは特に新しいものではありません。

Telegram チャネルへの投稿作成用 OpenClaw アシスタント

もう一つのケース、予期せず上手くいったのは、Telegram チャネルへの投稿準備用のアシスタントです。自動化、開発、AI 実験について定期的に投稿する Telegram チャネルがあります。主な問題は、投稿を継続的に書くのはかなり難しいということです。考えやアイデアはありますが、座ってきちんとテキストを形成する時間がないことが多いです。ですから、OpenClaw を編集者およびコンテンツ作成アシスタントとして使用することにしました。最初に、チャネルの全体の履歴をダウンロードしてモデルに渡し、私の執筆スタイルを完全に理解させました。要するに、以下を分析するよう依頼しました:

  • 私がどのように考えを定式化するか;
  • どのような表現を使用するか;
  • 通常、投稿の構造をどのように構築するか;
  • 冗談やアイロニーをどこに追加するか。

その後、私の執筆スタイルを説明するシステムプロンプトを作成しました。今、エージェントはおおよそ「私がどのように書くか」を理解しています。

その後のプロセスは非常にシンプルに見えます。音声メッセージを口述するか、以下のような複数のテーゼを書くことができます:

  • 「新しいツールについて話す」;
  • 「なぜそれが興味深いのか説明する」;
  • 「いくつかの実用的な結論を追加する」。

エージェントはこれらのテーゼを取り、それらを完全なテキストに展開し、投稿の草案を作成します。そして、私が通常チャネルで書くのと同じスタイルで書くようにしています。その後、テキストを開き、少し編集して、余分なものを削除し、どこか詳細を追加します—投稿の完成です。

つまり、エージェントは著者を置き換えるのではなく、プロセスを大幅に加速しています:最初から書く代わりに、既に完成した草案から始めます。3月4日からのすべての投稿は、その助けを借りて書いています。そして、これが私の人生と私の頭から考えを抽出することを大幅に簡素化していることを言わなければなりません。

小さなチャネルにとって、これは予期せず有用でした。投稿がより速く準備され、「座って書き始める」というバリアはほぼ消えます。

音声メッセージの認識を接続した方法

コーディングエージェントとポスト作成補助エージェントが音声メッセージを正しく処理できるようにするには、もう1つの課題を解決する必要がありました — 音声メッセージの認識。

OpenClawには、Whisperのようなモデルを通じた音声サポートが組み込まれています。これはWhisperをローカルにインストールし、構成し、サーバーの性能またはクラウド経由で認識を実行します(このためopenaiからのapi tokenを渡す必要があります)。

会社に既に独自の音声処理サービスがあったため、車輪を再発明することなく、泥臭いカスタムプロバイダーに接続することにしました。

アーキテクチャはおおよそこんな感じになりました:

  1. Telegramボットが音声メッセージを受信します。
  2. ファイルがトランスクリプションサービスに送信されます。
  3. サービスはオーディオをテキストに変換します。
  4. テキストがエージェントに返送されます。
  5. エージェントはそれを通常のテキストリクエストのように処理します。

私たちのサービスにはいくつかのレベルの処理があります。まず、メイン認識モデルが使用されます。それが対応できない場合、または何かが失敗する場合は、他のモデルへのfallbackがあります。結果として、システムはかなり確実に音声をテキストに変換します。

最も「魔法的な」部分は、「クロー」をトランスクリプションサービスに接続する方法でした。別のエージェントに、別の実プロジェクトで私たちのプロバイダーとの統合がどのように実装されているかを確認し、すべての詳細(キューにリクエストを投げる方法、結果をポーリングする方法、トークンをどこに送信するか)を1つのMDファイルの形式で説明するよう依頼しました。

エージェントはすべてを自分で設定し、アクセストークンを私に要求し、必要な場所に入力し、音声メッセージ処理用のhookを追加すると、すべてが魔法のように機能しました!

実質的には、これはTelegramチャットを開発と自動化のための音声インターフェースに変え、長いメッセージを常に入力するよりもはるかに便利であることが判明しました。

中間結論

私はOpenClawを数週間しか使用していないため、グローバルな結論を下すのは早すぎます。しかし、いくつかの中間的な観察をすでに定式化することができます。

1. これは確実に「魔法のようなAI従業員」ではありません。

エージェントが人間を完全に置き換えるというインターネット上のすべてのストーリーは大きく誇張されています。経済と信頼性はまだこのように機能することを許可していません。エージェントは個別のタスクを実行できますが、完全に監視なしで残すのはかなり危険です。

2. これは非常に優れた生産性増幅器です。

以前は10〜15分をルーチン(プロジェクトを開く、ファイルを見つける、小さな修正を行う、MRを作成する)に費やす必要があった場所では、この連鎖の一部をエージェントに委譲するだけです。

3. 最も重要なのは、エージェントを適切に制限することです。

私が実際に機能しているすべてのケースは、1つの原則に基づいています:エージェントは、安全に機能できるシステムのみへのアクセス権を持ちます。

  • コーディングエージェントはプロダクションへのアクセス権を持ちません;
  • エージェントは個別の仮想マシンで動作します;
  • すべての変更はMRを通じて、手動検証を経ています。

つまり、エージェントはドラフト作業を行い、最終決定は人間が行います。

4. 非常に具体的なタスクが最も機能します。

エージェントに明確で限定されたタスクが与えられると—例えば「プロジェクトを修正する」、「ポストのドラフトを作成する」、「テキストを分析する」—うまく対応します。タスクが一般的すぎたり曖昧すぎたりすると、効率が大幅に低下します。確かに高価なモデルを使用して多くのお金を費やすことはできますが、このアプローチは明らかに私のものではありません。

claude codeのガイドとコンテンツを共有するチャネル。ニュース(制限が10倍削減されるような場合など)およびプロジェクト向けにclaudeで実装するツール。チャネル:https://t.me/claudedevolper