UiPath Documentation
ixp
latest
false
Communications Mining ガイド
重要 :
このコンテンツの一部は機械翻訳によって処理されており、完全な翻訳を保証するものではありません。 新しいコンテンツの翻訳は、およそ 1 ~ 2 週間で公開されます。

一括削除

CLI を使用して、Communications Mining からデータを一括で削除します。単一のソースまたはバケットから時間範囲ごと、またはデータセット全体から、年齢ベースの保持を使用します。

CLI には、履歴データのクリーンアップや保持ポリシーの適用など、データを一括で削除する 3 つの方法が用意されています。

コマンドスコープこれは以下に使用します
re delete bulk1 つのソースコメントを時間範囲で削除する
re delete bulk-emails1 つのバケット未加工メールを時間範囲で削除する
re pruneリストするデータセット内のすべてのソースとバケットデータセット全体、コメント、未加工のメールを一緒に適用する年齢ベースの保持
警告:

re delete bulkre delete bulk-emails 実行したらすぐに削除します。確認プロンプト、ドライ ラン、バックアップはありません。まずは自分で作成してください。削除した内容をバックアップするのは re prune のみです。

このセクションでは、 CLI がすでにインストールおよび設定されていることを前提としています。削除元のすべてのプロジェクトに対して、読み取りおよび削除 の権限 が必要です。バックアップから復元するには、コメントとメールをアップロードする権限と、アノテーションを復元するための データセット - 確認 権限が必要です。

コマンドが実行するオプションについては、 re <command> --helpを実行するか、 コマンド リファレンスを参照してください。

注:

3 つのコマンドとも、期間は、Communications Mining™ にアップロードされた日時ではなく、コメントまたはメールの timestamp フィールドに基づいています。

re delete bulkre delete bulk-emailsの場合、範囲の両端は任意です。どちらも指定しないと、コマンドはソースまたはバケット全体をカバーします。--from-timestamp 包括的です。 --to-timestamp はコメントのみで、メールのみです。

データを削除する前にデータをバックアップする

コメントを削除または変更する前に、必要に応じて注釈付きコメントをバックアップして、モデルトレーナーの手動作業を誤って失わないようにすることができます。

re get comments \
  <project_name/source_name> \
  --dataset <project_name/dataset_name> \
  --reviewed-only true \
  --file <output_file_name.jsonl>
re get comments \
  <project_name/source_name> \
  --dataset <project_name/dataset_name> \
  --reviewed-only true \
  --file <output_file_name.jsonl>

ソースが複数のデータセットに追加されている場合は、それらのデータセットごとに前述のコマンドを実行する必要があります。

このコマンドは、削除によって削除されたコメントではなく、保持 --include-annotated=false コメントをキャプチャします。これらをキャプチャするには、削除しようとしているのと同じ範囲をエクスポートします。ソースには「バッチ ダウンロード」で説明されているように、--from-timestamp--to-timestampとともにre get commentsを使用し、バケットには以下のようにします。

re get emails \
  <project_name/bucket_name> \
  --from-timestamp FROM_TIMESTAMP \
  --to-timestamp TO_TIMESTAMP \
  --file <output_file_name.jsonl>
re get emails \
  <project_name/bucket_name> \
  --from-timestamp FROM_TIMESTAMP \
  --to-timestamp TO_TIMESTAMP \
  --file <output_file_name.jsonl>
注:

添付ファイルの内容は、re get comments--attachments true渡したときにのみエクスポートされ、 にre create comments--attachments <directory>渡したときにのみ再度アップロードされます。これらがない場合、バックアップには添付ファイルのメタデータは保持されますが、ファイル自体は保持されません。

ソースからコメントを削除する

警告:

注釈を削除するとモデルのパフォーマンスが変わります。

削除するコメントが、アノテーションが行われた可能性がある 1 つ以上のデータセットに追加されている場合、アノテーション済みのコメントを削除すると、今後、それらのデータセットのモデルのパフォーマンスが変化します。パブリッシュ済みのモデルは影響を受けません。

オプションで、アノテーション済みのコメントをスキップするようにCLIを設定できます。

次のコマンドは、アノテーション済みのコメントを除き、 FROM_TIMESTAMP から TO_TIMESTAMP までのソース内のすべてのコメントを削除します。タイムスタンプは RFC 3339 形式である必要があります (例:1970-01-02T03:04:05Z

re delete bulk \
  --source <project_name/source_name> \
  --include-annotated=false \
  --from-timestamp FROM_TIMESTAMP \
  --to-timestamp TO_TIMESTAMP
re delete bulk \
  --source <project_name/source_name> \
  --include-annotated=false \
  --from-timestamp FROM_TIMESTAMP \
  --to-timestamp TO_TIMESTAMP

注釈付きのコメントを削除する場合は、 --include-annotated=trueを設定できます。

注:

ここでは、ソースを含むすべてのデータセット (表示されないデータセットを含む) でアノテーションが行われたコメントを --include-annotated=false に保持します。re pruneでは、より狭いルールが使用されます。

コメントを削除しても、解析元の未加工のメールは削除されません。

バケットからメールを削除する

未加工のメール自体を削除するには、バケットを時間範囲で対象にします。

re delete bulk-emails \
  --bucket <project_name/bucket_name> \
  --from-timestamp FROM_TIMESTAMP \
  --to-timestamp TO_TIMESTAMP
re delete bulk-emails \
  --bucket <project_name/bucket_name> \
  --from-timestamp FROM_TIMESTAMP \
  --to-timestamp TO_TIMESTAMP

これにより、範囲内のすべてのメールが削除されます。これには、これまで操作していたソース以外のソースに解析されたメールも含まれます。これらのメールからすでに解析されたコメントは削除されません。

代わりに個々のメールを削除するには、一度に最大 32 個の ID を渡します。

re delete emails \
  --bucket <project_name/bucket_name> \
  <email_id>...
re delete emails \
  --bucket <project_name/bucket_name> \
  <email_id>...
警告:

常に少なくとも 1 つの ID を渡します。re delete emailsre delete commentsも空のリストをチェックしず、IDを持たない削除リクエストは意図したよりもはるかに多くのものを削除するリスクがあるため、展開されていないプレースホルダーと空のシェル変数に注意してください。

データセット全体で古いデータをプルーニングする

re prune 、1 回の実行で 1 つ以上のデータセットに年齢ベースの保持が適用され、以下が削除されます。

  • カットオフより古いコメント (リストするデータセット内のすべてのソースからの)。
  • カットオフより古いメール。それらのソースが読み取ったすべてのバケットから。

カットオフは、暦日の境界ではなく、実行が開始された正確な瞬間です ( --older-than-daysを引いた位置)。

警告:

re prune はデータを完全に削除します。書き込まれるバックアップは実行を元に戻す唯一の方法であり、個人データが含まれています。バックアップは安全な場所に書き込んで安全に保管し、常に最初にドライ ランを実行します。

プルーニング実行の仕組み

  1. 解決スコープ。--datasetsに渡すデータセット内のすべてのソースと、それらのソースが読み取ったすべてのバケットがスコープ内にあります。
  2. 共有ソースを確認します。スコープ内のソースが、リストに含まれていないデータセットにも属している場合、実行は中止され、そのデータセットに名前が付けられます。確認できるのは、読み取り権限を持つデータセットのみです。
  3. 確認。このコマンドは、スコープとそれに適用される注意事項を要約し、ユーザーを待機します。--dry-run-y これはスキップします。
  4. バックアップします。まず、対象となる各データセット内の確認済みのすべてのコメント、次に削除対象として選択されたコメントとメール
  5. 検証してから削除します。この実行により、すべてのバックアップ ファイルがマニフェスト内のレコード数とチェックサムと照合され、1 つの不一致があると、何かが削除される前に中止されます。

ドライ ランは手順 4 で停止します。実際のバックアップを書き込んで、削除する内容を報告しますが、検証も削除も行いません。

プルーンの実行

--dry-runから始めます。

re prune \
  --datasets <project_name/dataset_name> \
  --older-than-days 730 \
  --backup-dir <backup_directory> \
  --dry-run
re prune \
  --datasets <project_name/dataset_name> \
  --older-than-days 730 \
  --backup-dir <backup_directory> \
  --dry-run

カウントが正しいと思われたら、 を --dry-runせずに同じコマンドを実行します。

リストしたデータセットのいずれかでレビューされたコメントは、年齢に関係なく既定で保持されます。自分がアクセスできないデータセット内でのみアノテーションが行われたコメントはカウントされず、削除されます。渡す --include-annotated 古いコメントは、アノテーションが行われているかどうかに関係なく削除できます。上記のモデルのパフォーマンスへの影響を念頭に置いてください。

1 つのメールボックスをプルーニングする

--mailbox、削除 する内容を 1 つのメールボックスから同期されたデータに限定します。これは、バケットが複数のメールボックスを受信し、そのうちの 1 つのメールボックスのみがプルーニングが必要なメールボックスの場合に便利です。メールは、正確なメールボックス名に基づいてフィルター処理されます。コメントは、 Mailbox ID ユーザー プロパティで大文字と小文字を区別せずに照合されます。このプロパティは、送信元の 変換タグ がメールボックス名を記録する場合にのみメールの解析によって設定されます。

注:

一致する Mailbox ID を持たないコメントは一致しないため、スコープ内のコメントにそのプロパティが含まれていない場合、メールボックス スコープの実行ではそれらのコメントは削除されません。--mailboxを利用する前に、変換タグを re get sources で確認してください。

--mailbox 、アノテーションのバックアップの範囲を絞り込むことはありません。

バックアップに含まれる内容

実行ごとに の下に新しいフォルダーが作成され --backup-dir、実行が開始された UTC 時刻にちなんで名前が付けられます。re prune 既存のフォルダーを再利用することはありません。

<backup_directory>/20260807T104500Z/
├── manifest.json
├── annotations/<dataset-id>/<source-id>.jsonl
├── deleted-comments/<source-id>.jsonl
└── deleted-emails/<bucket-id>.jsonl
<backup_directory>/20260807T104500Z/
├── manifest.json
├── annotations/<dataset-id>/<source-id>.jsonl
├── deleted-comments/<source-id>.jsonl
└── deleted-emails/<bucket-id>.jsonl
PATHコンテンツ
manifest.json実行の概要と、各バックアップ ファイルのインデックス。
annotations/対象となる各データセット内の確認済みのすべてのコメントとそのアノテーション、データセットとソースごとに 1 つのファイル (削除されるコメントだけでなく)。
deleted-comments/削除対象として選択されたコメント (ソースごとに 1 つのファイル) で、 re get commentsと同じ形式で、アノテーションは含まれません。
deleted-emails/削除対象として選択されたメール (バケットごとに 1 つのファイル) (未加工の MIME コンテンツを含む)。

マニフェストには、実行のパラメーター (run_idcutoffinclude_annotatedmailboxdatasets)、削除セットのサイズ (comment_countemail_count)、およびすべてのバックアップ ファイルについて、そのファイルがカバーする resource 、バックアップ フォルダーを基準にした file パス、レコード count 、および crc32 チェックサムが記録されます。

注:

comment_countemail_count は、実行で選択した削除セットのサイズです。マニフェストは何かが削除される前に書き込まれ、後で更新されないため、正常に削除された内容の記録ではありません。

バックアップから復元する

復元は手動で、通常の re create コマンドを使用します。バックアップ ファイルには、名前とともに ID ( re get datasetsre get sources 、および re get buckets リストの ID で名前が付けられます。マニフェストでは、各削除セット ファイルの resource フィールドでカバーするソースまたはバケットが示されます。マニフェスト内の各ファイルの count は、そのファイルが保持するレコードの数であり、復元するレコードと比較して価値があります。

削除したコメントをソースに復元します。

re create comments \
  --source <project_name/source_name> \
  --file <backup_directory>/<run_id>/deleted-comments/<source-id>.jsonl
re create comments \
  --source <project_name/source_name> \
  --file <backup_directory>/<run_id>/deleted-comments/<source-id>.jsonl

既定のプルーニングでは、リストしたデータセット内のコメントにアノテーションが行われたまま維持されるため、アノテーションは を使用した実行後にのみ --include-annotated。注釈のバックアップから復元します — re create annotations はそのファイルを読み込み、注釈のみをアップロードし、コメント自体は変更しません。

re create annotations \
  --source <project_name/source_name> \
  --dataset <project_name/dataset_name> \
  --file <backup_directory>/<run_id>/annotations/<dataset-id>/<source-id>.jsonl
re create annotations \
  --source <project_name/source_name> \
  --dataset <project_name/dataset_name> \
  --file <backup_directory>/<run_id>/annotations/<dataset-id>/<source-id>.jsonl

削除したメールをバケットに復元します。

re create emails \
  --bucket <project_name/bucket_name> \
  --file <backup_directory>/<run_id>/deleted-emails/<bucket-id>.jsonl
re create emails \
  --bucket <project_name/bucket_name> \
  --file <backup_directory>/<run_id>/deleted-emails/<bucket-id>.jsonl
警告:

アノテーションのバックアップには、削除されたコメントだけでなく、データセット内の確認済みのコメントすべてがカバーされるため、アノテーションを復元すると、実行時の状態のアノテーションが再適用されます。バックアップにあるコメントの実行以降に行われた作業内容の確認が上書きされます。

未加工のメールをバケットにアップロードし直すと、そのバケットから読み取ったソースに未加工のメールが解析され、コメントが再作成されます。意図しない限り、同じソースのメールとコメントの両方を復元しないでください。コメントではなくメールを復元した場合は、コメントが再び表示されるまで待ってからアノテーションを復元します。アノテーションはすでに存在するコメントにのみ適用できます。

re create commentsre create emails はアップロードであるため、CLI はそれらに対する AI ユニットの料金に同意するよう求めます。re create annotations は課金されません。

制限事項と注意事項

バックアップと復元:

  • コメントの添付ファイルの内容はバックアップされません。添付ファイルのメタデータのみが保存されるため、添付ファイルの内容は復元できません。メールは丸ごとバックアップされるため、MIME コンテンツに含まれる添付ファイルは保持されます。
  • 却下された抽出フィールドのアノテーションは復元されません。これらのファイルはバックアップに存在しますが、アップロード形式で再適用する方法がありません。
  • ドライ ランでは、実際のバックアップが書き込まれます。削除するデータをすべて読み取って に書き込むため、出力は他のバックアップと同じように安全に扱われ --backup-dir

削除スコープと動作

  • リストしたデータセット内の注釈のみがコメントを保護します。ユーザーがアクセスできないデータセット内でのみアノテーションが行われたコメントは、アノテーション未実施として扱われ、削除され、そのアノテーションはバックアップされません。
  • メールの削除は、バケット内の年齢ごとです。--mailboxがない場合、他のソースやデータセットにフィードするメールも含め、それらのスコープ内にあるかどうかに関係なく、カットオフより前の日付のメールはすべて各スコープ内のバケットから削除されます。
  • リストのデータセット以外のソースはスコープ外です。バケット内のメールが削除されていても、コメントは削除されません。これにより、未加工のメールがもう存在しないコメントが残る可能性があります。
  • 共有ソース チェックでは、読み取り可能な情報のみが表示されます。スコープ内のソースが、アクセスできないプロジェクトのデータセットにも属している場合、そのデータセットではここで削除されたコメントが失われ、実行によって警告を表示することはできません。
  • 削除はトランザクションではありません。途中で失敗した場合 (ネットワーク エラーなど)、すでに削除されているデータは削除されたままになります。バックアップは変更されていないため、コマンドを再実行するか、バックアップから復元します。

このページは役に立ちましたか?

接続

ヘルプ リソース サポート

学習する UiPath アカデミー

質問する UiPath フォーラム

最新情報を取得