خب بچهها بیاین با هم یه دنیای جالب رو کشف کنیم: دنیای خطهای باستانی چین و اینکه چطور دانشمندها دارن سعی میکنن با هوش مصنوعی این خطوط عجیب رو بفهمن و مدل کنن. قضیه دقیقاً از جایی شروع میشه که هزاران سال پیش، چینیها روی استخوانهای جادویی (که بهش میگن Oracle Bones، یعنی استخوانهایی که روش پیشگویی و متنهای مهم رو حک میکردن) نمادهایی مینوشتن که با چینی مدرن کلی فرق دارن.
حالا امروزه یکی از علاقههای اصلی محققها این شده که با مدلهای زبانی یا همون Language Models (LMs) – یعنی برنامههایی که یاد میگیرن زبان رو بفهمن و تولید کنن – این متون باستانی رو تحلیل کنن. اما یسری مشکل اساسی دارن:
یکی اینکه متون اصلاً زیاد نیست! یعنی برخلاف متون انگلیسی یا چینی مدرن که پلیلیستهاشون تا دلت بخواد پُره، متون سنگنوشتههای باستانی خیلی کم و نایابه. همین باعث میشه مدلهای هوش مصنوعی مثل Generative AI (که یعنی هوش مصنوعیای که خودش میتونه محتوا مثل متن و تصویر بسازه!) نتونن خوب یاد بگیرن.
دومین دردسر اینه که تو این خطوط قدیمی، کلی نشونه، کاراکتر و حالت عجیب غریب وجود داره که اصلاً تا حالا برای کامپیوترها رمزگشایی و کدگذاری نشده. یعنی اگر کسی بخواد این نمادها رو به سگمنت دیجیتالی و قابلخوندن برای هوش مصنوعی تبدیل کنه، فعلاً وسیله مناسبی نداره و نمیشه درست خوندشون.
برای حل این دردسرا، یک تیم محقق، InteChar رو ساختن. InteChar یه «لیست یکپارچه و قابل گسترش از کاراکترهای باستانی» هست که واقعاً میشه گفت دست همه رو باز میذاره. یعنی چی؟ یعنی اومدن کاراکترهای عجیب استخوانی (همونی که تا حالا کد نداشتن) رو با کاراکترهای سنتی و مدرن چینی قاطی کردن و یک لیست کامل ساختن تا دیگه چیپگذاری و دیجیتالی کردن متنهای قدیمی آسون بشه.
اینطوری، تاریخنویسان و هوش مصنوعیکارها الان دیگه یه پایگاه داده منظم دارن که باهاش بتونن الگوهای زبانی باستان رو مدل کنن. برای تست این کار، تیم InteChar یه مجموعه داده هم آماده کرد که اسمش Oracle Corpus Set یا خلاصهش OracleCS هست. توضیح در مورد «Corpus» هم بدم: Corpus مجموعهی بزرگی از متنه که محققها برای آموزش هوش مصنوعی استفاده میکنن. OracleCS شامل نمونههایی هست که متخصصها با دقت درست کردن و بعد با کمک مدلهای زبانی مدرن (که گفتم LLM یعنی Large Language Model) دادهها رو بیشتر کردن تا دیتای کافی داشته باشن.
حالا چه نتیجهای گرفتن؟ آزمایشهای تیم نشون داد مدلهایی که با این لیست InteChar روی OracleCS آموزش دادن، توی کار فهم و ترجمه متون باستانی چین خیلی پیشرفت کردن و نسبت به مدلهایی که با روش قبلی آموزش میدیدن، عملکرد خیلی بهتری داشتن. این یعنی حالا میشه با خیال راحتتر سراغ تحلیل متون خیلی قدیمی رفت و اطلاعات بیشتری از فرهنگ و زبان مردم اون دوران پیدا کرد.
در کل، میشه گفت InteChar خیلی به درد کسایی میخوره که به فرهنگ و تاریخ چین باستان علاقه دارن یا میخوان هوش مصنوعیشونو برای کار روی زبانهای نایاب آماده کنن. خلاصه، با این کار محققها یه قدم اساسی به جلو برداشتن تا رمز و راز نوشتههای استخوانی رو راحتتر کشف کنیم!
منبع: +