物理AIをパイロット段階から実用段階へ移行させる
現実世界の過酷な条件下でも安定して機能するフィジカルAIを構築する。
現実世界の複雑さを、信頼性の高いフィジカル AI へ
実世界で動作するAIは、研究室では期待を上回る成果を示しても、環境が訓練分布から外れると現実環境では破綻しがちです。モデルの本番運用における性能を向上させるため、希少で予測不能なものも含め、実世界のあらゆる条件を捉えるよう設計されたマルチモーダルなデータシステムを提供します。
センサー分野の高度な専門知識にアクセス
LiDAR、レーダー、マッピング、ドライブレコーダー、360°画像などを用いて、多様なエッジ条件におけるデータの取得とキャリブレーションを行います。
マルチセンサー融合で構築する
3D点群を用いて、物理世界の正確な空間的・時間的表現にモデルを基づかせましょう。
実環境のダイナミクスでモデルを学習する
Go beyond a single frame and capture physics, motion, and scenario diversity to understand movement in real-world conditions.
複数センサーのラベリングを簡素化
センサータイプ間のアノテーションを効率化し、追加の運用負担なくプロダクション品質のデータパイプラインを構築します。
マルチセンサーラベリングで一貫性のある正確なデータを取得しましょう
Segments.ai by Uber を使えば、お持ちの 2D 画像データと 3D 点群データを1つのビューに統合し、アノテーションを簡単に行えます。
画像のラベリング
機械学習支援ツールでピクセル単位で正確なアノテーションを作成しましょう。
3D点群アノテーション
機械学習支援機能で3D点群のアノテーションを高速化。
複数センサーのデータ融合
ラベル付けを高速化するため、2D画像に3D点群を重ね合わせます。
14日間の無料トライアルを開始する
よくある質問
フィジカルAIとは何ですか?
Physical AI は、カメラ、光検出・測距 (LiDAR)、レーダーなどのセンサーを用いて現実世界のデータを収集し、自律システムやロボットに展開されたAIモデルが物理空間を理解して、現実世界の条件下で適切に動作できるようにします。
センサー融合とは何ですか?
センサー融合は、情報の精度と信頼性を高めるために、複数のセンサーから得ら れるデータを統合するプロセスです。異なる種類のセンサー (LiDAR、レーダー、カメラなど) からの情報を組み合わせることで、システムは環境をより包括的に把握できます。センサー融合は、個々のセンサーにおける誤差や故障の影響を低減することにもつながります。この技術は、自動運転車 (AV) やロボティクスなど、さまざまな用途で使われています。
センサー融合の最も一般的な応用の一つは、LiDARによる3D点群や前方・側方・後方カメラの2D画像など、ロボタクシーに搭載されたさまざまなセンサーを組み合わせることです。
3Dセンサーにはどのような種類がありますか?
センサーは、光、熱、音などの物理的な刺激を検知し、それに応答する装置です。センサーの 種類によって、機能を果たすために用いる技術は異なります。例えば、LiDARセンサーやレーダーセンサーはレーザーや電波を使って周囲の環境を検知しますが、超音波センサーは音波を利用します。
自動車分野、自動運転車(AV)、およびロボティクスでは、どのような種類の3Dセンサーが使用されていますか?
LiDAR (光検出および測距)
高精度・長距離・高速なデータ取得。LiDARは、自動運転車やロボットのマッピングや障害物回避に最適です。
レーダー (電波探知および測距)
レーダーセンサーは、さまざまな気象条件下でも長距離で物体を検知できるため、衝突回避や自動運転などの用途に最適です。
SONAR (音響測位および測距)
ソナーセンサーは音波を発し、音波が物体に当たって反射して戻ってくるまでの時間を測定します。ロボティクスや自動車分野では、対象物までの距離を測定するために使用できます。
構造化光
構造化光センサーは、3Dスキャナーを用いて物体の3D寸法を測定します。高解像度と高精度により、3Dスキャンやマッピングの用途に適しています。
タイムオブフライト (ToF) センサー
ToFセンサーは、深度センシング技術を用いて距離を測定します。動作が速く信頼性が高いため、ジェスチャー認識、物体追跡、ロボットのナビゲーションといった用途に適しています。
ステレオビジョンセンサー
ステレオビジョンセンサーは、人間の両眼視を再現するために2つ(またはそれ以上)のセンサーを使用します。高精度な奥行き推定と高い空間分解能、低コストにより、障害物回避、3Dマッピング、ロボットナビゲーションといった用途に適しています。
超音波センサー
超音波センサーは低コストで使いやすく、幅広い材料を検出できるため、駐車支援や物体検出などの用途に適しています。
複数センサーのデータのラベル付けにおけるベストプラクティスは何ですか?
Step 1: Overlay the data
- The first step is to calibrate and align all the sensor views, then overlay all of your data into a single view. This fused view gives your labeler more context, allowing it to tell what groups of point clouds represent.
Step 2: Label the 3D point clouds
- We advise that you label in 3D before projecting to 2D for a few reasons, even though it may seem counterintuitive. Labeling in 3D first often proves to be significantly more efficient, even if your primary interest is in obtaining 2D labels.
- Imagine you are driving past a stationary object like a traffic sign. Equipped with multiple cameras, this traffic sign remains visible in three of them as you pass by, spanning approximately 100 frames.
- Annotating this scenario using 2D bounding boxes would require you to label a total of 300 instances. However, in the 3D space, annotating this static, non-moving traffic sign would involve a single cuboid annotation.
- While labeling a 3D cuboid does take three times as long as annotating a 2D bounding box, it is still 100 times more efficient than labeling directly in the images.
Step 3: Project to 2D images
- Once you’ve labeled your 3D point clouds, you can calibrate and align them to your 2D image data. Segments.ai will automatically copy over object IDs to the 2D data, saving you hours of drawing bounding boxes. You only need to make minor adjustments during your quality control check.
早期融合と後期融合の違いは?
後期融合アプローチから早期融合アプローチへの移行は、自動運転やロボティクス企業の機械学習 (ML) モデルにおいて、ますます一般的になっている。
後期融合では、使用する各センサーごとに個別の機械学習モデルを用い、各モデルが独立した出力を生成します。これらの出力を統合または融合して、シーンの一貫した3D表現を生成します。複数のモデルをそれぞれ独立に実行し、その結果を後で組み合わせる手法です。
早期融合は、より現代的な手法です。各センサーごとに別々のモデルを使うのではなく、すべてのセンサーデータを単一の機械学習モデルに入力します。この統合モデルは、3D空間内で直接予測を行うように設計されています。
アーリーフュージョンを効果的にするには、ボクセルグリッドがシーン表現として有効な手段となる。ボクセルグリッドは規則的な構造を持ち、このアプローチに適している。テンソルとして捉えられるため、エンドツーエンドの予測が可能になる。入力から出力までの全過程を単一のモデルで予測できる。