InteChar: راهی باحال برای سر و کله زدن با خط استخوانی چین باستان!

Fall Back

خب بچه‌ها بیاین با هم یه دنیای جالب رو کشف کنیم: دنیای خط‌های باستانی چین و اینکه چطور دانشمندها دارن سعی می‌کنن با هوش مصنوعی این خطوط عجیب رو بفهمن و مدل کنن. قضیه دقیقاً از جایی شروع میشه که هزاران سال پیش، چینی‌ها روی استخوان‌های جادویی (که بهش میگن Oracle Bones، یعنی استخوان‌هایی که روش پیش‌گویی و متن‌های مهم رو حک می‌کردن) نمادهایی می‌نوشتن که با چینی مدرن کلی فرق دارن.

حالا امروزه یکی از علاقه‌های اصلی محقق‌ها این شده که با مدل‌های زبانی یا همون Language Models (LMs) – یعنی برنامه‌هایی که یاد می‌گیرن زبان رو بفهمن و تولید کنن – این متون باستانی رو تحلیل کنن. اما یسری مشکل اساسی دارن:

یکی اینکه متون اصلاً زیاد نیست! یعنی برخلاف متون انگلیسی یا چینی مدرن که پلیلیست‌هاشون تا دلت بخواد پُره، متون سنگ‌نوشته‌های باستانی خیلی کم و نایابه. همین باعث میشه مدل‌های هوش مصنوعی مثل Generative AI (که یعنی هوش مصنوعی‌ای که خودش می‌تونه محتوا مثل متن و تصویر بسازه!) نتونن خوب یاد بگیرن.

دومین دردسر اینه که تو این خطوط قدیمی، کلی نشونه، کاراکتر و حالت عجیب غریب وجود داره که اصلاً تا حالا برای کامپیوترها رمزگشایی و کدگذاری نشده. یعنی اگر کسی بخواد این نمادها رو به سگمنت دیجیتالی و قابل‌خوندن برای هوش مصنوعی تبدیل کنه، فعلاً وسیله مناسبی نداره و نمیشه درست خوندشون.

برای حل این دردسرا، یک تیم محقق، InteChar رو ساختن. InteChar یه «لیست یکپارچه و قابل گسترش از کاراکترهای باستانی» هست که واقعاً میشه گفت دست همه رو باز می‌ذاره. یعنی چی؟ یعنی اومدن کاراکترهای عجیب استخوانی (همونی که تا حالا کد نداشتن) رو با کاراکترهای سنتی و مدرن چینی قاطی کردن و یک لیست کامل ساختن تا دیگه چیپگذاری و دیجیتالی کردن متن‌های قدیمی آسون بشه.

اینطوری، تاریخ‌نویسان و هوش مصنوعی‌کارها الان دیگه یه پایگاه داده منظم دارن که باهاش بتونن الگوهای زبانی باستان رو مدل کنن. برای تست این کار، تیم InteChar یه مجموعه داده هم آماده کرد که اسمش Oracle Corpus Set یا خلاصه‌ش OracleCS هست. توضیح در مورد «Corpus» هم بدم: Corpus مجموعه‌ی بزرگی از متنه که محقق‌ها برای آموزش هوش مصنوعی استفاده می‌کنن. OracleCS شامل نمونه‌هایی هست که متخصص‌ها با دقت درست کردن و بعد با کمک مدل‌های زبانی مدرن (که گفتم LLM یعنی Large Language Model) داده‌ها رو بیشتر کردن تا دیتای کافی داشته باشن.

حالا چه نتیجه‌ای گرفتن؟ آزمایش‌های تیم نشون داد مدل‌هایی که با این لیست InteChar روی OracleCS آموزش دادن، توی کار فهم و ترجمه متون باستانی چین خیلی پیشرفت کردن و نسبت به مدل‌هایی که با روش قبلی آموزش می‌دیدن، عملکرد خیلی بهتری داشتن. این یعنی حالا میشه با خیال راحت‌تر سراغ تحلیل متون خیلی قدیمی رفت و اطلاعات بیشتری از فرهنگ و زبان مردم اون دوران پیدا کرد.

در کل، میشه گفت InteChar خیلی به درد کسایی می‌خوره که به فرهنگ و تاریخ چین باستان علاقه دارن یا می‌خوان هوش مصنوعی‌شونو برای کار روی زبان‌های نایاب آماده کنن. خلاصه، با این کار محقق‌ها یه قدم اساسی به جلو برداشتن تا رمز و راز نوشته‌های استخوانی رو راحت‌تر کشف کنیم!

منبع: +