2023年4月1日土曜日

VisionFive 2(Debian Image 202302 Released)でTensorFlow Lite EdgeTPU delegate

目的


前回のブログでは、RISC-VのSBCであるVisionFive 2でTensorFlow LiteのXNNPACK delegateを実行してみた。
今回はRISC-VのSBCであるVisionFive 2にGoogle Coral USB Acceleratorを組み合わせてTensorFlow LiteのEdgeTPU delegateを実行してみる。


環境


  • VisionFive 2 Debian Image 202302 Released
  • OpenCV 4.7.0(build from source)
  • TensorFlow Lite v2.12 Python Interpreter(build from source)
  • libedgetpu Grouper Release(build from source)


つまづきポイント


  • libedgetpuはTensorFlow Lite v2.12に未対応&プラットフォーム特有の問題がある。
    このため、Makefileを変更する。
  • Plag&Playデバイスの権限を追加しないとUSB Acceleratorにアクセス画で拒否される。
    (Debianユーザーだと当たり前の問題?)


構築


前回のブログと同様、今回はOpenCVを使ってUSBカメラのキャプチャした画像を物体検出してみる。
なお、動作させてみるPythonコードは自分のリポジトリを使用。



OpenCV、TensorFlow Lite Python Interpreterのソースビルド&インストール


ここまでは、前回のブログと同じ手順。


libedgetpuのソースビルド&インストール


Edge TPU runtime libraryのリポジトリをcloneして、Makefileでのビルドを行う。

ただ、公式のリポジトリそのままではいろいろと問題があり、ビルドできない。
  • TensorFlow Lite v2.12ではビルドエラーが発生する。
    libedgetpuはTensorFlow Lite v2.5対応でアップデートがないため。。。
    主にTensorFlow Liteのファイル、ディレクトリ構造が変更になったため。
  • ライブラリファイルが生成されない。
    オブジェクトファイルとリンクするTensorFlow Liteのライブラリの順番に問題がある。
    x86やARMのnative buildでは発生しない。RISC-V native build特有?
    ただ、リンクの順番は間違っている気がする。
  • undefined symbol: __atomic_exchange_1 が発生する。
    RISC-V native buildではlibatomicを明示的に指定(-latomic)する必要がある。
    (ちょっと前のARM native buildも同様だったのでGCCの問題?)

そこで、Makefile、ソースコードを修正することで対応する。
パッチをGitHub gistにアップしたのでそれを利用。

まずはTensorFlow Lite Python Interpreterをビルド&インストールしておく。
次にlibedgetpuのリポジトリをclone、パッチをあててビルドする。
$ sudo apt install libabsl-dev libflatbuffers-dev xxd libusb-1.0-0-dev
$ git clone https://github.com/google-coral/libedgetpu.git
$ cd libedgetpu/
$ git apply ~/visionfive2_libedgetpu_build.patch
$ cd makefile_build/
$ TFROOT=/home/user/tensorflow/ make -j$(nproc) libedgetpu
$ sudo cp ../out/direct/k8/libedgetpu.so.1 /usr/local/lib
$ cd ..
$ sudo cp debian/edgetpu-accelerator.rules /etc/udev/rules.d/99-edgetpu-accelerator.rules


SSDLite MobileDet EdgeTPUをEdge TPU Modelにエクスポート


Coralで公開されているSSDLite MobileDet EdgeTPUのEdge TPU Modelを利用する。

エクスポートしたEdge TPU ModelをボードにSCPなどで転送しておく。


USBデバイスのPlug&Playの許可


Debian Imageのユーザー(user)で操作する際、Plug&Playデバイスにアクセスする権限が不足している。
userをplugdevグループに追加しておく。
$ sudo usermod -aG plugdev $USER

権限を追加後、念の為再起動しておく。

当初、アクセス権がないことに気がつかず、次のようなエラーで困っていた。
Traceback (most recent call last):
  File "/home/user/.local/lib/python3.10/site-packages/tflite_runtime/interpreter.py", line 166, in load_delegate
    delegate = Delegate(library, options)
  File "/home/user/.local/lib/python3.10/site-packages/tflite_runtime/interpreter.py", line 104, in __init__
    raise ValueError(capture.message)
ValueError

During handling of the above exception, another exception occurred:

Traceback (most recent call last):
  File "/home/user/tflite-cv-example/benchmark/benchmark_tflite.py", line 107, in <module>
    main()
  File "/home/user/tflite-cv-example/benchmark/benchmark_tflite.py", line 58, in main
    interpreter = make_interpreter(args.model, args.thread, args.delegate)
  File "/home/user/tflite-cv-example/benchmark/utils/tflite_util.py", line 44, in make_interpreter
    tflite.load_delegate(EDGETPU_SHARED_LIB)
  File "/home/user/.local/lib/python3.10/site-packages/tflite_runtime/interpreter.py", line 168, in load_delegate
    raise ValueError('Failed to load delegate from {}\n{}'.format(
ValueError: Failed to load delegate from libedgetpu.so.1

そこで、以前のissueを参考にlibedgetpuのLOG_LEVELを変更、動作させた結果、USBデバイスにアクセスが拒否されていたことから権限にないことに気がついた。
I /home/user/libedgetpu/makefile_build/../driver/usb/local_usb_device.cc:60] ConvertLibUsbError: USB error -3 [OpenDevice]
I /home/user/libedgetpu/makefile_build/../driver/usb/local_usb_device.cc:1013] OpenDevice: [/sys/bus/usb/devices/2-2]
I /home/user/libedgetpu/makefile_build/../driver/usb/local_usb_device.cc:1050] OpenDevice: checking bus[2] port[2]
I /home/user/libedgetpu/makefile_build/../driver/usb/local_usb_device.cc:60] ConvertLibUsbError: USB error -3 [OpenDevice]
I /home/user/libedgetpu/makefile_build/../tflite/edgetpu_context_direct.cc:401] Failed to open device [Apex (USB)] at [/sys/bus/usb/devices/2-2]: Permission denied: USB error -3 [OpenDevice]


動作確認


前回と同様、自分のリポジトリのPythonコードを実行してみる。

Edge TPUを接続して、実行


$ cd ~
$ git clone https://github.com/NobuoTsukamoto/tflite-cv-example.git 
$ cd tflite-cv-example/detection/python
$ python3 object_detection_tflite_capture_opencv.py \
    --model /home/user/models/ssdlite_mobiledet_edgetpu_320x320_quant_coco_edgetpu.tflite \
    --label ../models/coco_labels.txt 






最後に


VisionFive 2はM.2 KeyのIFもあるから、M.2 Acceleratorを接続できればおもしろいんじゃないかな?

つぎはGPU delegate。

2023年3月30日木曜日

VisionFive 2(Debian Image 202302 Released)でTensorFlow Lite XNNPACK delegate

目的


RISC-VのSBCであるVisionFive 2でTensorFlow LiteのXNNPACK delegateを実行してみる。
RISC-V CPUでTensorFlow Lite。


環境


  • VisionFive 2 Debian Image 202302 Released
  • OpenCV 4.7.0(build from source)
  • TensorFlow Lite v2.12 Python Interpreter(build from source)


つまづきポイント


  • RISC-V CPU向けのTensorFlow Lite Python Interpreterは提供されていない。
    このため、ソースからビルド(CMakeを使う)が必要。
    ただし、バグがありビルドできないためパッチをあてて対処。


構築


今回はOpenCVを使ってUSBカメラのキャプチャした画像をEfficientDet Liteを使って物体検出してみる。
なお、動作させてみるPythonコードは自分のリポジトリを使用。



OpenCVのビルド&インストール


まず、OpenCVをソースビルドし、インストールする。
これは、自分の前回のブログを参照。


TensorFlow Lite(Python Interpreter)のビルド&インストール


TensorFlow v2.12.0でビルドを行う。
CMakeでビルドする必要があるが、r2.12ブランチではバグがありビルドできない。。。(masterブランチでは修正済みの模様)
このため、tensorflow/lite/CMakeLists.txtを修正する。
自分がやっているTensorFlow Liteのyoctoのレシピであるmeta-tensorflow-liteにあるパッチをあてて対処。


TensorFlowのリポジトリをcloneし、パッチをあてて、ビルドしてみる。
ビルドはおおよそ30分ぐらい?

$ sudo apt install swig libjpeg-dev zlib1g-dev python3-dev python3-numpy
$ sudo apt install python3-pybind11
$ sudo apt install python3-setuptools
$ sudo apt install python3-wheel
$ sudo apt install python3-pip

$ cd ~
$ git clone https://github.com/NobuoTsukamoto/meta-tensorflow-lite.git
$ git clone https://github.com/tensorflow/tensorflow.git
$ cd tensorflow/
$ git checkout v2.12.0
$ git apply ~/meta-tensorflow-lite/recipes-framework/tensorflow-lite/files/001-v2.12-Fix-CMAKE_Build_Error.patch

$ export BUILD_NUM_JOBS=4
$ ./tensorflow/lite/tools/pip_package/build_pip_package_with_cmake.sh
pip3 install /home/user/tensorflow/tensorflow/lite/tools/pip_package/gen/tflite_pip/python3/dist/tflite_runtime-2.12.0-cp310-cp310-linux_riscv64.whl


EfficientDet LiteをTensorFlow Lite Modelにエクスポート


モバイル向けの物体検出モデルであるEfficentDet LiteをTensorflow Liteにエクスポートする。
これはホストPC(やGoogle Colaboratory)で実行する。
以前、自分が作成したエクスポート用のノートブックを利用。
エクスポートしたモデル(今回はEfficientDet-Lite0)をボードにSCPなどで転送しておく。
今回は/home/user/modelsの配下に格納。


動作確認


USBカメラを接続して動作確認してみる。

$ cd ~
$ git clone https://github.com/NobuoTsukamoto/tflite-cv-example.git 
$ cd tflite-cv-example/detection/python
$ python3 object_detection_tflite_capture_opencv.py --model /home/user/models/efficientdet-lite0_fp32.tflite --label ../models/coco_labels.txt --thread 4

なお、コードではカメラIDを0固定で指定しているので、適宜書き換え(いつか直す)。
動作させたときの画面キャプチャ。
EfficientDet Lite0 FP32でだいたい500~600ms(4 Threads)。




最後に


今回はRISC-V CPUでTensorFlow Liteをやってみた。VisionFive 2だと割とサクサク動いて感動!(たしかにラズパイ4と比べるとだけど)。

次はEdgeTPUのアクセラレターとの組み合わせかな?

2023年3月29日水曜日

VisionFive 2(Debian Image 202302 Released)でOpenCVをビルドする

目的


RISC-VのSBCであるVisionFive 2でOpenCVをソースからビルドしてみる。


環境




つまづきポイント


  • additional packagesにあるQtは依存関係のライブラリのバージョンアップデートによりリンクエラーとなってしまうため有効としない。
  • FFmepg、GStreamerのpkgconfigのパスがおかしいためにCMakeでエラーが発生する。
    pkgconfigファイル内のパスを直接編集する。


ライブラリのインストール


OpenCVに必要(とおもわれる)ライブラリを片っ端からインストールする。

$ sudo apt -y install build-essential cmake
$ sudo apt -y install python3-numpy python3-dev python3-matplotlib
$ sudo apt -y install libeigen3-dev libgflags-dev libgoogle-glog-dev
$ sudo apt -y install libopenblas-dev gfortran
$ sudo apt -y install libopenblas-openmp-dev
$ sudo apt -y install libblas-dev libatlas-base-dev libblis-dev
$ sudo apt -y install liblapacke-dev
$ sudo apt -y install liblapack-dev
$ sudo apt -y install libgtk-3-dev
$ sudo apt -y install libhdf5-dev


FFmpeg & GStreamerのpkgconfigの修正


VisionFive 2の開発元が提供するパッケージでFFmpeg、GStreamerなどのpkgconfigファイルでライブラリのパスが誤っている。
  • ライブラリは/usr/localにインストールだが、pkgconfigでは/code_mm/targetを参照している。。。

(69-imageのころからパスを変更したようだけど、pkgconfigファイルの中身はそのままみたい)

一括でパスを置換してしまう。

$ sudo sed -i 's@/code_mm/target/usr@/usr/local@g' /usr/local/lib/pkgconfig/*.pc


OpenCVのビルド


あとはOpenCVのソースコードをダウンロードして、ビルドする。
ビルドは4〜5時間ぐらいだったかも。

$ cd
$ mkdir opencv
$ cd opencv
$ git clone -b 4.7.0 https://github.com/opencv/opencv.git
$ git clone -b 4.7.0 https://github.com/opencv/opencv_contrib.git
$ mkdir build
$ cd build
$ cmake  \
    ../opencv \
    -DOPENCV_EXTRA_MODULES_PATH=~/opencv/opencv_contrib/modules/ \
    -DOPENCV_ENABLE_NONFREE=ON \
    -DBUILD_EXAMPLES=ON \
    -DOPENCV_ENABLE_NONFREE=ON \
    -DWITH_OPENMP=ON \
    -DBUILD_EXAMPLES=ON \
    -DWITH_QT=OFF \
    -DWITH_VULKAN=ON
$ make -j3
$ sudo make install

最後に


これで色々とできるようになった。つぎはTensorFlow Liteをやってみる。


2022年7月10日日曜日

YoctoでGoogle CoralのEdgeTPU

 目的


今更ながらGoogle Coralのライブラリgoogle-coral/libedgetpuがbazelでなくてもビルドできることを知った。


なので、これをYoctoのレシピ化して見ることにした。


libedgetpuのレシピ


TensorFlow Liteをレシピ化しているmeta-tensorflow-liteに追加。


レシピ化するときにつまづいた点


すべてではないが、レシピかするときにつまずいた点、ちょっとだけ工夫した点を列挙。


ビルドのワーキングディレクトリの指定

今回、Makefileベースのレシピで作成したが、Makefileはトップディレクトリにない。
このため、${B}でMakefileがあるディレクトリを指定が必要。
ただ、Yoctoのドキュメントには

とあり、タスク[dirs]で指定して、${B}は有効でないとある。

しかしながら、タスク[dirs]で指定してもワークディレクトリは変更されなかった。。。
base.bbclassで上書き${B}で上書きされているので、${B}は必要なんじゃないのかな?
わたしの指定方法がまちがっているかもしれないが。。。


abseil-cppの必要なリンクするライブラリの不足


libedgetpuはabseil-cppのライブラリをいくつかリンクする。
Yoctoのkirkstoneにあるabseil-cppのバージョン( 20211102.0+gitX)はlibedgepuのGrouper(2021.7.27リリース)より新しい。
これが影響してか、ライブラリのリンクに不足(undefined symbol)が発生、パッチで修正した。

また、当初、Yoctoではなく、x86のubuntu22.04上でビルドしてリンク不足の修正を確認していた。その中でabseil-cppをソースビルド&スタティックリンクライブラリ(*.a)をリンクしたところ、undefined symbolが解消できないことがわかった(スタティックリンクだとabseeil-cppの一部がビルドされない?)。
Yoctoのabseil-cppのレシピは共有ライブラリ(*.so)を生成するオプションのため問題はなかったが、この違いによってハマってしまった。

libedgetpuのリポジトリにも同じようなissueがあり、解決できていなかったようなのでコメントしてみた。

gold リンカーを指定するとリンクエラー(risc-v)


RISC-V(meta-riscv)ターゲット向けにビルド時、goldリンカーはないとのエラーが発生する。
libedgetpuのMakefileでは -fuse-ld=gold が指定されている。
ARMターゲット(meta-raspberrypi)ではエラーにならないので、クロスコンパイラの違いが原因と思われる。
なので、Makefileから指定を削除した。



TensorFlow v2.9への対応


もともと、libedgetpuはTensorFlow v2.5のころのソースを一部利用している。
このなかでもcommon.cはC言語のソースだった。

TensorFlow v2.9では、common.cはcommon.ccに変更になっている。

これにあわせて、Makefileを修正している。


xxd: command not foundの解決


edgetpuのfirmwareをビルドする際にxxd(16進数のダンプコマンド)をつかっている。
このxxdコマンド、Yoctoでどのレシピを追加すればよいのかよくわからなかった、、、
OpenEmbedded Layer Indexをつかって検索してもよくわからず、、、

最終的にvim-nativeのレシピ(openembedded-core )を追加することで解決した。
(いつも使うコマンドがどんなパッケージにあるか?ってあまり意識しない時もある。こういうケースでは検索がなかなか大変。。。)


libedgetpu-maxとlibedgetpu-std


libedgetpuには動作周波数を変更する二つのライブラリが存在する。

この2つをレシピ化することにした。
方針としては以下にした。
  • レシピはlibedgetpu-std、libedgetpu-maxとする。
  • 共通部分をcommon.incに切り出して、EXTRA_OEMAKEに指定するフラグとインストールパス(do_install)を定義
  • お互いのレシピは同時に指定されたくないので、RCONFLICTSでコンフリクトするように指定。


ターゲットのBSP


今回は2つのBSPで動作させてみた。

Sipeed Lichee RV Dock向けについては、前回のブログを参照。
meta-riscvからforkしたリポジトリをつかう。

なお、Sipeed Lichee RV Dock向けについては、後述のとおり物体検出やセグメンテーションのモデルはうまく動いていない、、、


イメージの作成


いつもどおり、bitbakeしてみる。
Yoctoのバージョンはkirkstone。


Raspberry Pi 4


まずは、必要なリポジトリをclone。
$ git clone -b kirkstone git://git.yoctoproject.org/poky.git
$ git clone -b kirkstone git://git.yoctoproject.org/meta-raspberrypi
$ git clone -b kirkstone git://git.openembedded.org/meta-openembedded
$ git clone https://github.com/NobuoTsukamoto/meta-tensorflow-lite.git
$ source poky/oe-init-build-env rpi-build

$ bitbake-layers add-layer ../meta-openembedded/meta-oe/
$ bitbake-layers add-layer ../meta-openembedded/meta-python/
$ bitbake-layers add-layer ../meta-openembedded/meta-networking/
$ bitbake-layers add-layer ../meta-openembedded/meta-multimedia/
$ bitbake-layers add-layer ../meta-raspberrypi/
$ bitbake-layers add-layer ../meta-tensorflow-lite/

conf/auto.confに必要なパッケージを追加。
FORTRAN:forcevariable = ",fortran"
MACHINE ?= "raspberrypi4-64"
IMAGE_INSTALL:append = " \
  python3-tensorflow-lite \
  libedgetpu-max \
  opencv \
"
VIDEO_CAMERA = "1"

bitbake。
$ bitbake core-image-weston
...
Build Configuration:
BB_VERSION           = "2.0.0"
BUILD_SYS            = "x86_64-linux"
NATIVELSBSTRING      = "universal"
TARGET_SYS           = "aarch64-poky-linux"
MACHINE              = "raspberrypi4-64"
DISTRO               = "poky"
DISTRO_VERSION       = "4.0.1"
TUNE_FEATURES        = "aarch64 armv8a crc cortexa72"
TARGET_FPU           = ""
meta                 
meta-poky            
meta-yocto-bsp       = "kirkstone:4aeda14352a9fa9dd5ba50cf940a2b514fd1ac3c"
meta-oe              
meta-python          
meta-networking      
meta-multimedia      = "kirkstone:fcc7d7eae82be4c180f2e8fa3db90a8ab3be07b7"
meta-raspberrypi     = "kirkstone:0135a02ea577bd39dd552236ead2c5894d89da1d"
meta-tensorflow-lite = "main:4299e649292a9471732e1fff2dc0eb776aba68f5"
...

イメージをSDカードに書き込む。


Sipeed Lichee RV Dock


こちらも同様に必要なリポジトリをclone。
$ git clone -b kirkstone git://git.yoctoproject.org/poky.git
$ git clone -b kirkstone https://github.com/openembedded/openembedded-core.git
$ git clone -b kirkstone https://github.com/openembedded/meta-openembedded.git
$ git clone -b kirkstone_licheerv https://NobuoTsukamoto/riscv/meta-riscv.git
$ git clone https://github.com/NobuoTsukamoto/meta-tensorflow-lite.git
$ source poky/oe-init-build-env licheerv-build

$ bitbake-layers add-layer ../meta-openembedded/meta-oe/
$ bitbake-layers add-layer ../meta-openembedded/meta-python/
$ bitbake-layers add-layer ../meta-openembedded/meta-networking/
$ bitbake-layers add-layer ../meta-openembedded/meta-multimedia/
$ bitbake-layers add-layer ../meta-riscv/
$ bitbake-layers add-layer ../meta-tensorflow-lite/

conf/auto.confに必要なパッケージ・オプションを追加。
FORTRAN:forcevariable = ",fortran"
MACHINE ?= "licheerv"
IMAGE_INSTALL:append = " \
  python3-tensorflow-lite \
  libedgetpu-std \
  opencv \
"

bitbake。
$ bitbake core-image-minimal
...
Build Configuration:
BB_VERSION           = "2.0.0"
BUILD_SYS            = "x86_64-linux"
NATIVELSBSTRING      = "universal"
TARGET_SYS           = "riscv64-poky-linux"
MACHINE              = "licheerv"
DISTRO               = "poky"
DISTRO_VERSION       = "4.0.1"
TUNE_FEATURES        = "riscv64"
meta                 
meta-poky            
meta-yocto-bsp       = "kirkstone:4aeda14352a9fa9dd5ba50cf940a2b514fd1ac3c"
meta-oe              
meta-python          
meta-networking      
meta-multimedia      = "kirkstone:fcc7d7eae82be4c180f2e8fa3db90a8ab3be07b7"
meta-riscv           = "kirkstone_licheerv:9083c701acede92b2378eb3f0df77fefb8ae29a0"
meta-tensorflow-lite = "main:4299e649292a9471732e1fff2dc0eb776aba68f5"
...

イメージを書き込む。


動作確認


こちらのPythonスクリプトを使っての動作確認。
(レシピ化していないのでSDカードに直接コードとモデルをコピーした)


Raspberry Pi 4


ラズパイ向けでは正常に動作するようだ。


Sipeed Lichee RV Dock


Lichee RV Dockの場合、
  • USBの電力供給の関係で動作しないので、電源供給つきのUSB-HUBが必要。
    device descriptor read/64, error -71 が発生した場合は、電力の不足を疑う。
    (libedgetpu-stdの場合はHUBがなくてもいけるかもしれない)
  • 画像分類モデルはうまく動きそうだが、物体検出やセマンティクス・セグメンテーションのモデルはうまく動作しない。。。
    • 物体検出は結果がすべてNG。
    • セマンティクス・セグメンテーションはポツポツと点のように結果がおかしい。

2つ目の事象は現時点では解決できていない。。。
(なんだかUSBの通信の関係の気がするが、、、)
RISC-V特有でない気もしている。






最後に


ちょっと遅くなったけど、libedgetpuをYoctoのレシピにしてみた。
ラズパイ向けはうまく動いたが、LICHEE RV DOCK向けはおかしい部分がある。

RISC-VのSBCで動けば、おもしろくなってくると思う。
EdgeTPUに限らず、RISC-V+アクセラレーターの構成がEdge AIとしてはありえるんじゃないかな?

2022年7月9日土曜日

YoctoでSipeed Lichee RV Dock

 目的


前回のブログではYoctoのmeta-riscvとmeta-tensorflow-liteをつかって、Sipeed Lichee RV DockでOSイメージのビルドとTensorFlow-Liteの動作確認を行った。
ただし、meta-riscvにLichee RV Dock向けの対応(DTSなど)がないためUSBは使えない。

今回は、meta-riscvをforkしてU-Bootやカーネルなどを追加してLichee RV Dock向けBSPを作成して、USBが動作するところまで確認する。


参照


もともと、meta-riscvにはnezha allwinner d1の対応が含まれている。
Yocto Project Summit 2022.05で詳細が発表されていた模様。

これをもとにlinux-sunxiの情報と、 Archlinux Image Builderの情報をもとにBSPを作成してみる。


レシピ(BSP)の作成


meta-riscvをforkして作成。

ブランチは「kirkstone_licheerv」。

コミットはこちら。

おおきくわけて
  • machine configuration
  • boot0
  • opensbi
  • u-boot
  • linux kernel
  • wis
のレシピを変更・追加している。


machine configuration


machine/nezha-allwinner-d1.conf を参考にLichee RV 向けに変更している。

machineは「licheerv」。


boot0


nezha-allwinner-d1向けのレシピに対して修正。
COMPATIBLE_MACHINEに「licheerv」を追加している。


OpenSBI


OpenSBIもnezha-allwinner-d1と同様のであるため、レシピにlicheerv向けの追加を行っているのみ。


U-Boot


こちらはlicheerv向けに作成。

U-Bootのコードはsmaeul/u-bootを利用(ブランチは「d1-wip」)。
他、uEnvやtoc.cfgはnezha-allwinner-d1と同じものを利用。


Linux kernel


こちらもsmaeul/linuxを利用(ブランチは「riscv/d1-wip」)。
defconfigはsehraf/riscv-arch-image-builderのものを利用した(スクリプトから生成)。


wis


nezha-allwinner-d1と同じものを利用。
ただし、いつも参考にしているブログにあるとおりnezha-allwinner-d1のwisではイメージのサイズが大きい(約14GB)。

なので、今回はイメージサイズを約8GB程度にした。

--fixed-size 8000の部分。


イメージ作成(Bitbake)


core-image-minimalでbitbakeしてみる。
まずは、必要なリポジトリをclone。
$ git clone -b kirkstone git://git.yoctoproject.org/poky.git
$ git clone -b kirkstone https://github.com/openembedded/openembedded-core.git
$ git clone -b kirkstone https://github.com/openembedded/meta-openembedded.git
$ git clone -b kirkstone_licheerv https://NobuoTsukamoto/riscv/meta-riscv.git
$ source poky/oe-init-build-env licheerv-build

$ bitbake-layers add-layer ../meta-openembedded/meta-oe/
$ bitbake-layers add-layer ../meta-openembedded/meta-python/
$ bitbake-layers add-layer ../meta-openembedded/meta-networking/
$ bitbake-layers add-layer ../meta-openembedded/meta-multimedia/
$ bitbake-layers add-layer ../meta-riscv/

あとは、bitbake。
MACHINE=licheerv bitbake core-image-minimal

成功したら、*.wic.gzファイルをSDカードに書き込んでブートさせてみる。


動作確認




core-image-westonもやってみる


bitbakeでcore-image-westonをビルドして動かしてみた。



最後に


今回はRISC-V SBCのSipeed Lichee RV Dock向けのBSPをmeta-riscvのnezha-allwinner-d1を参考にやってみた。


2022年6月11日土曜日

Sipeed Lichee RV DockのYoctoでTensorFlow Lite v2.9

 目的


いつも参考にさせていただいているブログでRISC-V CPUのSipeed Lichee RV DockがYoctoで動くことを知った。


meta-tensorflow-liteはいままでQEMUでしか動かしたことがなかった。
Sipeed Lichee RV Dockは案外お安いというのもあり、一つ購入して実際に動かしてみたくなった。

購入したのは
  • Sipeed Lichee RV Dock Allwinner D1 Development Board RISC-V Linux Starter Kit
    without wifi 512M


イメージの作成


Yoctoでビルドする。
  • BSPにはmeta-riscv、バージョンはkikstone。
  • TensorFlow Liteのレシピにはmeta-tensorflow-lite。
  • TensorFlow Liteのバージョンはv2.9。
    • XNNPACK delegateしたいのでkirkstoneではなくて、mainブランチを使用。
  • ほんとうはCROPSを使いたかったけど、Fedora 36のpodmanだとうまくいかなかった。

まずは、必要なリポジトリをclone。
$ git clone -b 2.0 https://github.com/openembedded/bitbake.git
$ git clone -b kirkstone https://github.com/openembedded/openembedded-core.git
$ git clone -b kirkstone https://github.com/openembedded/meta-openembedded.git
$ git clone -b kirkstone https://github.com/riscv/meta-riscv.git
$ git clone https://github.com/NobuoTsukamoto/meta-tensorflow-lite.git
$ cd meta-tensorflow-lite
$ git checkout a58e5f1efbf5de17580e1f9f65f70d76715003b2

oe-init-build-env
$ source openembedded-core/oe-init-build-env build

auto.confに必要な情報(MACHINEとIMAGE_INSTALL)を追加。
$ cat conf/auto.conf 
FORTRAN:forcevariable = ",fortran"
MACHINE = "nezha-allwinner-d1"
IMAGE_INSTALL:append = "\
  python3-tensorflow-lite \
  libtensorflow-lite \
  python3-tensorflow-lite-example \
  tensorflow-lite-label-image \
  tensorflow-lite-minimal \
  tensorflow-lite-benchmark \
"

後はbitbake!
$ bitbake core-image-full-cmdline

...

Build Configuration:
BB_VERSION           = "2.0.0"
BUILD_SYS            = "x86_64-linux"
NATIVELSBSTRING      = "ubuntu-20.04"
TARGET_SYS           = "riscv64-oe-linux"
MACHINE              = "nezha-allwinner-d1"
DISTRO               = "nodistro"
DISTRO_VERSION       = "nodistro.0"
TUNE_FEATURES        = "riscv64"
meta                 = "kirkstone:4eb0b7468383a1d0314b3bfd43ea37c95de464d9"
meta-oe              
meta-python          
meta-networking      
meta-multimedia      = "kirkstone:0b78362654262145415df8211052442823b9ec9b"
meta-riscv           = "kirkstone:70e099d7ceca52a1dde2c978713012f6b20a9891"
meta-tensorflow-lite = "main:a58e5f1efbf5de17580e1f9f65f70d76715003b2"

出来上がったイメージ(tmp-glibc/deploy/images/nezha-allwinner-d1配下の*.wic.gz)をmicro sdカードに書き込む。

USBシリアル変換ケーブルを接続して、起動してみる。



補足:FORTRANの追加


meta-tensorflow-liteのレシピでTensorFlow Lite v2.9からビルド時にFortranコンパイラが必要となった模様。
おそらく、XNNPACKのビルドで必要。

YoctoではデフォルトでFortranコンパイラがないため、ビルドに失敗する。
このため、confに以下を追加する必要がある。
FORTRAN:forcevariable = ",fortran"


動作


起動した後、TensorFlow Liteが動作することを確認してみる。
meta-tensorflow-liteで追加できるサンプル・ツールは以下のとおり(kirkstone)。

TensorFlow Lite C++ image classification demo(label_image)のサンプルを動かしてみる。
# cd /usr/share/tensorflow/lite/examples/label_image/
# ./labe 
  --tflite_model ./mobilenet_v1_1.0_224.tflite \                              
  --labels ./labels.txt \                                                     
  --image ./grace_hopper.bmp \                                                
  --xnnpack_delegate 1 \                                                      
  --threads 1                                                                 
INFO: Loaded model ./mobilenet_v1_1.0_224.tflite                                
INFO: resolved reporter                                                         
INFO: Created TensorFlow Lite XNNPACK delegate for CPU.                         
XNNPACK delegate created.                                                       
INFO: Applied XNNPACK delegate.                                                 
INFO: invoked                                                                   
INFO: average time: 3214.8 ms                                                   
INFO: 0.860175: 653 653:military uniform                                        
INFO: 0.0481016: 907 907:Windsor tie                                            
INFO: 0.00786705: 466 466:bulletproof vest                                      
INFO: 0.00644932: 514 514:cornet, horn, trumpet, trump                          
INFO: 0.0060802: 543 543:drumstick 

XNNPACK delegateしていることを確認。

なお、label_imageにはxnnpack_delegateの引数を指定するとAbortする問題がある。
このため、レシピでパッチをあてて修正している。


ベンチマーク


さて、Sipeed Lichee RV DockのRISC-V CPUで画像分類モデルのベンチマーク(推論処理時間)をやってみる。
MobileNet V1、V2、V3 Small、V3 Largeでどの程度なのかを確認する。

ベンチマークはTFLite Model Benchmark Tool with C++ Binary(benchmark_model)を使用。
詳細の結果は以下のリポジトリにアップ。

CPUの情報を確認。
# cat /proc/cpuinfo 
processor       : 0
hart            : 0
isa             : rv64imafdc
mmu             : sv39
uarch           : thead,c906

ベンチマークの結果:Inference (avg) 、単位はms。
まあ、CPUのスペックもあるし、最適化もこれからと思う(INT8は全然最適化されていなさそう?)。

Model name Input Kind Lichee RV Dock
XNNPACK delegate
Mobilenet V1 dm=1.0 224x224 FP32 2874.29
INT8 10091.20
Mobilenet V2 dm=1.0 224x224 FP32 978.40
INT8 6210.03
Mobilenet V3 Large dm=1.0 224x224 FP32 754.20
INT8 4853.66
Mobilenet V3 Small dm=1.0 224x224 FP32 241.70
INT8 1444.20

最後に


はじめて、RISC-V の実機でTensorFlow Liteを動かしてみた。

きっとRISC-V CPUベースのSoCだと、きっと、GPUやアクセラレーターを使う方が主流になるはず?CPUで推論はメインではないとは思うのだけど、かなりおもしろかった。

処理時間はラズパイなどとは比べようもないのだけど、はじめてラズパイでTensorFlow Liteを動かした時のような感覚をおもいだした気がする。

これからもRISC-Vがあつくなるといいなぁ!!

2022年6月5日日曜日

2022.6.4の釣行

お昼に時間をもらってちょっとだけ。


おうちから10分で行ける渓流です。


う〜ん...


ボウズです。チェイスあったけどなぁ。