چطور با ترکیب دوربین معمولی و iToF عمق رو دقیق‌تر تشخیص بدیم؟

Fall Back

خب، بریم سراغ یه موضوع جذاب: تشخیص عمق توی تصویر! خیلی از دوربین‌های پیشرفته الان به روشی به اسم iToF مجهزن. حالا iToF چیه؟ یعنی Indirect Time-of-Flight، یه تکنولوژی که نور رو می‌فرسته و مدت زمانی که طول می‌کشه تا برگرده رو اندازه می‌گیره. با این کار می‌تونن بفهمن اشیا چقدر با دوربین فاصله دارن.

ولی این روش چند تا مشکل اساسی داره: وضوح تصویر (رزولوشن)ش خیلی بالا نیست، میدان دیدش (Field of View یا همون FoV) محدوده، و توی صحنه‌های پیچیده ممکنه تصویرهاش دقت کافی نداشته باشه یا ساختارش بهم بریزه.

حالا یه راه‌حل خیلی باحال پیشنهاد دادن تو این مقاله: بیایم داده‌های iToF رو با تصویر RGB (همون عکس رنگی که با هر دوربینی می‌گیریم) ترکیب کنیم! RGB همون تصاویری هستن که می‌بینیم و سه کانال رنگی قرمز، سبز و آبی دارن. ولی تفاوتش اینه که اطلاعات عمق رو نداره.

ایده اینه که اول نقشه عمق iToF رو که معمولا محدوده، بیاریم با تصویر RGB که میدان دیدش بازتره، «هم‌تراز» کنیم. یعنی چی؟ یعنی با یه جور کالیبراسیون دقیق هندسی، پیکسل به پیکسل دو تا تصویر رو رو هم بیاریم تا دقیقا بتونن ازشون اطلاعات برداشت کنن.

مرحله بعدیش جالبه: توی مدل یادگیری عمیق (یا همون شبکه عصبی که کلی مدل توش یاد گرفتن)، یه معماری دوگانه («دوال-انکودر») استفاده می‌کنن که هم ویژگی‌های تصویر عمق رو می‌کشه بیرون، هم ویژگی‌های رنگی رو. جالب‌تر اینکه این سیستم یه راهنمایی از عمق به‌صورت «مونکولار» (یعنی فقط با یک دوربین و بدون هیچ سنسور اضافه) هم می‌گیره و می‌گه: آها! مثلاً گوشه‌های تصویر به احتمال زیاد برجسته‌اس یا صاف.

حالا ترکیب این سه تا منبع داده باعث می‌شه هم مرز اشیا تیزتر دیده بشه، هم اطلاعات عمق دقیق‌تر باشه و هم میدان دید گسترده‌تر به دست بیاد. انگار معجون همه چی تمومه!

برای اینکه مطمئن بشن کارشون از بقیه بهتره، کلی آزمایش هم روی داده‌های مصنوعی (یعنی دیتاهایی که خودشون ساختن) و واقعی انجام دادن. نتیجه چی شد؟ معلوم شد روش پیشنهادی این تیم نسبت به مدل‌های قبلی توی دقت، ثبات ساختاری و کیفیت تصویر عمق خیلی بهتر ظاهر میشه.

در کل این تحقیق نشون داده که اگر داده یه دوربین iToF رو درست با دوربین RGB ترکیب کنن و از راهنمایی‌های یادگیری ماشین هم سریغ استفاده کنن، دیگه مشکل وضوح کم یا میدان دید محدود نداریم. خلاصه، یه قدم مهمه برای اینکه دوربین‌ها بتونن صحنه رو خیلی شبیه‌تر به چیزی که واقعا هست، تشخیص بدن.

منبع: +