Technology

Physical AIの、しくみのすべて。

予備知識は、いりません。デモの裏側で何が起きているのかを、図と映像でひとつずつ紐解いていきます。

Big Picture

全体像 — 「AIが考える場所」がちがう、2つのかたち。

Physical AIは、カメラで見て、AIが考えて、ロボットの体で動くシステムです。このカタログの2つのデモは同じAWSの部品でできていますが、「考える」をクラウドに置くか、エッジ(ロボットのそば)に置くかが違います。まず、その2つのかたちをそのまま図にしました。

Stack 01 — VLA

VLAモデル — 見て、聞いて、動くAI

VLA(Vision-Language-Action)は、カメラ映像(Vision)と言葉の指示(Language)を入力すると、ロボットの動き(Action)を出力するAIモデル。ChatGPTのようなAIが「言葉」を返すかわりに、「関節の角度の列」を返すと考えるとわかりやすいです。

カメラ2視点の映像と関節角度データが並ぶ記録ビューア

入力: いまの世界と、やってほしいこと

カメラ画像(俯瞰+手先)、「消しゴムを片付けて」という指示、いまの関節角度

VLAモデルの解説スライド(カメラ映像と言葉の指示から動きを直接生成)

AIが考える

学習した経験から「この状況ならこう動く」を推論。数十ステップ先までの動きをまとめて生成(Action Chunking)

ロボットアームが消しゴムに向かって動き出す様子

出力: 次の動き

各関節の目標角度の列。これを毎秒何十回も繰り返して、なめらかな動作になる

VLAモデル図鑑 — しまってAIが実機で試した4モデル

どのモデルも「見る → 理解する → 動きを生成する」の3段構成が基本で、違いは規模と得意分野。しまってAIチームは4モデルを実機で並行検証し、本番には確実性で選びました。

本番ライブ採用
ACT
ALOHA (Stanford/UC Berkeley系)

ACT — 軽量で確実な職人

タスク特化の軽量モデル。一連の動きをまとめて予測するAction Chunkingで小さな物体の精密把持が得意。

本番ブースのライブデモは、3タスクを1つのACTモデルで実演
Hugging Face

SmolVLA — フルオープンな入門機

コード・重み・学習データまでApache 2.0で公開。手元のGPUでも動かせる規模で、始める1台目に最適。

AWS上に構築した検証環境でも学習・実機推論を実践
NVIDIA GR00Tのアーキテクチャ図Image: NVIDIA
NVIDIA

GR00T — ヒューマノイド由来

NVIDIAのロボット基盤モデルファミリー。System1/System2の2層設計で「反射」と「思考」を分担。

しまってAIではペンの把持タスクを実機検証
π0.5
Physical Intelligence

π0.5 — 汎化に強い本命格

PaliGemma 2B + Gemma 300Mベースの大型モデル。初めて見る配置にも対応する汎化力が持ち味。

しまってAIでは134エピソードで学習し、3タスクを実機検証

ロボットが実際に動く様子

マーカーを掴んでカップへ収める
アームで瓶のふたを開ける

Stack 02 — Physical AI Ops

ロボットの学ばせ方 — 収集、生成、学習、評価。

VLAモデルは、人がお手本を見せる「模倣学習」で育ちます。現場を写し取り(収集)、仮想空間で増やし(生成)、クラウドで鍛え(学習)、シミュレータと実機で測る(評価)。足りないデータが見つかったら、また収集へ — このサイクルを何周も回して精度を上げるのが、ロボット版のMLOpsです。

1収集 — 現場を写し取る
人がリーダーアームでお手本を実演(テレオペレーション)し、映像と関節角度を数十回分記録。データはAmazon S3に保存し、由来を管理して後からやり直せる形に
2生成 — 仮想空間で増やす
2つの方法でデータを増やす。合成データ生成(SDG)は、実写の動きを保ったまま色・素材・照明を変えた映像をAIが自動生成。シミュレーション(Isaac Sim on EC2 GPU)は仮想空間でお手本を自動収集
3学習 — クラウドで鍛える
Amazon SageMakerのGPUでVLAモデルにデモの動きを追加学習(ファインチューニング)。実験条件と結果は記録して、いつでも同じ学習を再現できる
4評価 — 測って、1に戻る
まずシミュレータで安全に確かめ、次に実機で成功率を測る。できないタスク・苦手な配置が見つかったら、そのデータを追加収集して1に戻る — このループが精度を育てる

Stack 03 — Sim2Real

Sim2Real — 仮想空間で練習して、現実で本番。

NVIDIA Isaac Sim

実機でのデータ収集は手間がかかります。そこで、実機とそっくりな仮想空間(NVIDIA Isaac Sim)をクラウドGPU上に構築し、お手本データの自動生成や学習前の検証を行います。このGPU環境は、AWSがGitHubで公開しているサンプル実装 Remote AWS Development Station を使って、コーディングエージェント入りの開発環境ごと必要なときに立ち上げています。見た目や物理の「仮想と現実のギャップ」は、カメラ校正(ChArUco)や、条件をあえてランダムに変える学習でならしていきます。

Isaac Sim on AWS GPUドメインランダマイゼーションカメラ校正

Stack 04 — Edge

エッジコンピュータ — 現場に置く、小さな頭脳。

NVIDIA Jetson AGX ThorImage: NVIDIA

NVIDIA Jetson AGX Thor

しまってAIのVLA推論を担うのは、手のひらサイズのAIコンピュータ。カメラ映像から関節の動きを計算するループを、ネットワークを介さずローカルで回すため、通信遅延の影響を一切受けません。学習済みモデルはクラウド(Amazon S3)からAWS Systems Manager経由で配信され、現場のコンピュータが受け取って動き出します。

ローカル推論 = 遅延ゼロ設計モデルはクラウドから配信
NVIDIA Jetson Orin NanoモジュールImage: NVIDIA

Jetson Orin Nano Super — 軽量なGPUでも動かせる

必ずしも大型GPUは要りません。手のひらサイズ・低消費電力(7〜25W)のこの開発キットで、実際にVLAの実機推論も行っています。まず小さく始めるのに十分な頭脳です。

Stack 05 — Remote Ops

開発と運用 — 人がいない間も、改善は止まらない。

改善ループの一周 — 実際の流れ

ある日の一周は、こんな流れです。⑧までいくと、また①へ — 一周まわすたびに、ロボットは確実に賢くなります。

Kiro Crewアイコン
1計画 — Kiroと作戦会議
「どのデータで、どのモデルを、どう学習させるか」をKiro(AIエージェント)と一緒に決める。実行の管理はKiro Crewが担い、前回の結果も踏まえた作戦づくり
撮影済みデモ動画のライブラリ
2探索 — 素材と土台選び
撮影した実演動画のライブラリと、LeRobotのACTやSmolVLAなどのOSSベースモデルを見比べて、勝てる組み合わせを探す
合成データ生成のbefore/after
3生成 — データを増やす
「ロボットの学ばせ方」で見た2本立て — 合成データ生成(SDG)とNVIDIA Isaac Simの仮想空間。NVIDIA Cosmosのような世界基盤モデルも選択肢
Amazon SageMaker公式アイコン
4学習 — 複数パターン並行
条件を変えた複数のモデルをAmazon SageMakerで同時に学習。夜のうちに回して、朝に結果を見比べる
AWS Systems Manager公式アイコン
5整備 — エッジも遠隔改善
AWS Systems Manager経由でJetson上のKiro CLIに指示し、推論プログラムの改善や設定の調整も遠隔で済ませる
実機での推論実行 — グリッパでマーカーを掴む
6実行 — 実機で試す
新しいモデルをJetsonへ配備し、実機で推論を実行。掴めるか、置けるか — 採点者は現実の世界
Amazon S3公式アイコン
7蓄積 — 結果はクラウドへ
実行結果や映像はAmazon S3へ。どのデータとモデルで何が起きたかを、後から辿れる形で管理する
↺
8改善 — 次の一手へ
Kiroが結果から次の一手を提案。例: 「カップに入れる」ができたら「取り出す」を足し、状況を見てどちらをやるかロボット自身が決められるところまで。ループは①へ戻って、また一周

進化の記録 — 同じアームの、別の日

ループが一周まわるたび、できることが増えていく。4本の映像は、その積み重ねの記録です。

記録 01できること — 掴んで、入れる

はじめの一歩 — 掴んで、コップへ

映像は実際の実験環境。学習を終えたばかりのモデルが、マーカーを掴んでコップへ — 途中で人が置き場所を変えても、追いかけて掴み直します。この一角のJetsonとアームに、ここまで説明したループがそのままつながっていて、結果は次の学習データになります。

記録 02+ 迷いなく、立て直す

数日後 — 動きに、迷いがなくなった

上の映像から数日、エージェントが改善を重ねた結果がこれです。掴み損ねてもすぐに立て直し、コップまでの動きがひと続きになりました。ループが回り続けるかぎり、ロボットは上手くなり続けます。

記録 03+ 取り出して、戻す

さらに — 「取り出す」も、覚えた

入れるだけだったロボットが、いまはカップから取り出して戻すところまでをひとつのモデルでこなします。「取り出す」お手本を集めて学び直した、ループのもう一周の成果です。

記録 04+ 人の手を離れて、自ら改善をはじめた

そして — 人の手を離れて、自ら改善をはじめた

「入れる」と「取り出す」の2つのモデルを持ち、マットの状態を見てどちらを実行するかを自分で決めながら、片づけては取り出す往復を、人が席を離れたあとも自律で続けます。見守るのはKiro(AIエージェント)。うまくいったか、どこで時間がかかったかを記録し、次に集めるお手本の候補にしていく — 改善のループが人の手を離れ、ロボット自身のものになった姿です。

REC俯瞰 / 手元32倍速2026-09-12

ログは実際の運用記録から抜粋・要約したものです。

Kiro CrewKiro が見守っています — 監修ログ(抜粋)
開始
マットの状態を見て「入れる」か「取り出す」かを自分で選びながら、往復を始めます
途中経過
順調です。取り出しは影の向きで少し時間がかかる — 次に集めるお手本データの候補として記録しました
つまずき
掴み損ねがありましたが、その場で立て直しました。介入は不要 — 見守りを続けます
終了 → 次の一周へ
自律で回したワークの実行記録を受けて、次のモデル学習やデータ収集に反映。ロボットは自律的に改善を続けます

AWS Services

支えているAWSサービス

Physical AIといっても、使うのは特別なサービスではありません。いつものAWSの組み合わせです。

Amazon Bedrock状況理解・会話・エージェントの頭脳
Amazon SageMakerVLAモデルの学習と実験記録(MLflow)
Amazon S3学習データとモデルの保管庫
Amazon EC2 (GPU)Isaac Simシミュレーション環境

Learn More

もっと深く知る

AWS公式Physical AI デモの裏側 Part 2: ロボット開発編(AWSブログ)https://aws.amazon.com/jp/blogs/news/physical-ai-demo-part2-robot-development/ AWS公式Physical AI デモの裏側 Part 1: 企画からステージ制作、アプリケーション開発まで(AWSブログ)https://aws.amazon.com/jp/blogs/news/physical-ai-autonomous-agent-demo-backstage-part1/ 動画フィジカルAI、本当に使える? (TechLIVE by ITmedia)https://www.youtube.com/watch?v=mze4hh3SFU8&t=212s 動画【最新技術】機械のカラダを持ったAI「フィジカルAI」など 幕張メッセで展示会(日テレNEWS)https://www.youtube.com/watch?v=oDidAkivrwk AWS公式Physical AI — AIエージェントによる自律オペレーションの実現(AWSブログ)https://aws.amazon.com/jp/blogs/news/physical-ai-autonomous-agent-demo/ AWS公式AWS IoTで実現するロボット遠隔テレオペレーション体験(AWSブログ)https://aws.amazon.com/jp/blogs/news/aws-summit2026-aws-iot-robot-tele-operation/ AWS公式知的なフィジカルAI構築: エッジからクラウドへ(AWSブログ)aws.amazon.com/jp/blogs/news/building-intelligent-physical-ai-from-edge-to-cloud... AWS公式Building intelligent physical AI: From edge to cloud (AWS Open Source Blog)aws.amazon.com/blogs/opensource/building-intelligent-physical-ai-from-edge-to-cloud... 教科書Physical AI 教科書編 — VLA・模倣学習・カメラ校正・Sim2Realを基礎から(しまってAIチーム)https://d2n6k30rxqc18u.cloudfront.net/textbook.html AWS公式AWS Solutions: Building physical AI enabled smart machines on AWShttps://docs.aws.amazon.com/solutions/building-physical-ai-enabled-smart-machines-on-aws/ OSSHugging Face LeRobot — 誰でも始められるロボット学習ライブラリhttps://github.com/huggingface/lerobot OSSSO-ARM100 / SO-101 アーム(TheRobotStudio, GitHub)https://github.com/TheRobotStudio/SO-ARM100 AWS公式Amazon Bedrock AgentCorehttps://aws.amazon.com/jp/bedrock/agentcore/ AWS公式AWS IoT Corehttps://aws.amazon.com/jp/iot-core/