پایگاه خبری بادیجی | اخبار فناوری اطلاعات و ارتباطات

گزارش عملکرد ایرانسل در سال 1400 منتشر شد: ثبت درآمد عملیاتی 22 هزار میلیارد تومانی در یک سال

نوآم چامسکی: ChatGPT نمونه‌ای شگفت‌انگیز از یادگیری ماشینی اما مصداقی از ابتذال شر است

مدیرعامل بقراط: توسعه زیرساخت اینترنت، ضرورت توسعه سلامت دیجیتال است

سامسونگ احتمالاً برای گوشی‌های گلکسی و لپ‌تاپ‌های گلکسی بوک هسته CPU اختصاصی می‌سازد

وزارت رفاه: اجرای طرح کالابرگ الکترونیک در سراسر کشور آغاز شد

افزایش فعالیت سامسونگ در حوزه گجت‌های پوشیدنی: ثبت‌نام‌های تجاری «گلکسی گلس» و «گلکسی رینگ»

هجوم کتاب‌های نوشته‌شده با ChatGPT به فروشگاه آمازون؛ نویسندگان نگران هوش مصنوعی هستند

وزیر ارتباطات: از ممنوعیت واردات آیفون استقبال نمی‌کنیم، اما باید به‌سمت گوشی‌های تولید داخل برویم

OpenAI با پلتفرم Foundry منابع اختصاصی برای اجرای مدل‌های هوش مصنوعی را فراهم می‌کند

صرافی والکس چطور امنیت کاربران خود را تامین می‌کند؟

در پنل موبایل و صنعت VOD مطرح شد: صداوسیما طبق قانون اساسی حق تنظیم‌گری ندارد

رقیب چینی ChatGPT از راه رسید؛ شروع آزمایش عمومی چت‌بات MOSS

ثبت‌نام در دوازدهمین دوره نمایشگاه اینوتکس آغاز شد / فرصتی برای هم‌افزایی اکوسیستم استارتاپی در شرایط محدودیت‌های اینترنتی

گوگل رسماً از رقیب ChatGPT رونمایی کرد: Bard از راه رسید

پنتاگون درباره استفاده فزاینده از هوش مصنوعی در جنگ‌افزارهای آینده هشدار داد

معرفی ایران به عنوان دومین کشور دارای بیشترین محدودیت اینترنت

سریع‌ترین قطار سوخت هیدروژنی جهان با سرعت 160 کیلومتر بر ساعت در چین شروع به کار کرد

پنج پیش‌بینی در مورد بانکداری و فین‌تک برای سال 2023 به قلم ران شولین

پرجزئیات‌ترین تصاویر ماه از روی زمین با راداری ضعیف‌تر از یک مایکروویو ثبت شد

مایکروسافت می‌خواهد فناوری هوش مصنوعی OpenAI را به آفیس اضافه کند

سامسونگ نگران کاهش تقاضای جهانی برای محصولات خود است

انجمن تجارت الکترونیک با ارائه اینترنت طبقاتی مخالفت کرد

تأمین مالی فیلیمو از بورس، بدون حضور در تابلوی بورسی / دستی بر آتش بورس، اما با فاصله و بدون استرس

ماجرای پول نقد ندادن دستگاه‌های خودپرداز چیست؟ / مقاومت بانک‌ها یا بالارفتن تقاضا برای پول نقد؟

عصر تراکنش به پله شصت‌وپنجم رسید / بدون نوآوری واقعی محکوم به شکستیم

اپل واچ می‌تواند سطح استرس را به‌طور دقیق اندازه‌گیری کند

گردشی در استارتاپ دکتر دکتر: مطبی به وسعت اینترنت

فردابانک؛ یک نئوبانک غیربانکی

قابلیت ‏های اینترنت اشیا و کلان‏ داده برای کشف تقلب و کلاهبرداری در بانکداری دیجیتال

در مراسم رونمایی از سالنامه مهاجرت مطرح شد: نیمی از مدیران میانی در مسیر مهاجرت هستند

مینگ-چی کو: اپل آیفون SE 4 را تولید نمی‌کند یا آن را تا 2024 به تعویق می‌اندازد

جورج هاتز، هکر مشهور آیفون پس از حدود پنج هفته از سمت خود در توییتر استعفا کرد

۱۱۴ شعبه اچ‌اس‌بی‌سی در بریتانیا تعطیل می‌شود / آیا مردم بانکداری آنلاین را بیشتر دوست دارند؟

بررسی کیف‌ پول سخت‌افزاری؛ ابزار نگهداری ارزهای دیجیتال

تسلا سرویس گیمینگ استیم را برای خودروهای جدید مدل X و S منتشر کرد

واکنش وزیر ارتباطات به افزایش قیمت قبوض تلفن ثابت: مخابرات برای نوسازی و توسعه نیاز به منابع دارد

احتمال خروج رایتل از بازار / از دست رفتن بیش از ۳۰۰ میلیارد ریال از درآمد اپراتور سوم کشور

دیپ‌مایند هوش مصنوعی Dramatron را معرفی کرد؛ ابزاری برای نوشتن فیلمنامه

اپل و اریکسون بر سر پتنت‌های شبکه‌های سلولی به توافق رسیدند

مرکز توسعه تجارت الکترونیکی: مهمتر از اینماد، توجه به رتبه اعتماد کسب و کارها است

حمایت استارتاپ‌ها از کسب‌وکارهای کوچک و خانگی به یاد کیان پیرفلک: «قایقی باید ساخت»

نمایشگاه تلکام از تقویم نمایشگاهی حذف شد

اپل احتمالاً مشغول توسعه متاورس مخصوص به خودش است

رکورد ترافیک داخلی با شش ترابیت بر ثانیه شکسته شد/ کاربران فعال پلتفرم‌های داخلی افزایش یافت

انتقاد نمایندگان مجلس از افزایش هزینه آبونمان قبوض تلفن ثابت / رئیس مجلس دستور پیگیری داد

افشای مشخصات کامل شیائومی 13 و 13 پرو پیش از معرفی رسمی

آیفون 15 پرو احتمالاً از USB-C با تاندربولت 3 پشتیبانی خواهد کرد

دامنه ابر آروان از دسترس خارج شد

شورای عالی فضای مجازی خبر داد / حضور ۶۰درصدی کسب‌و‌کارها در پلتفرم‌های داخلی

درخواست فوری کارگروه اقتصاد دیجیتال در هیات دولت از شاپرک: دستور الزام ای‌نماد را لغو کنید

عضو کمیسیون اینترنت نصر تهران / مردم با دستور به پیام‌رسان داخلی کوچ نمی‌کنند

گفت‌و‌گو با آزاد معروفی، مدیرعامل لاوان‌ارتباط / به حال اقتصاد دیجیتال باید گریست

انتقاد معاون فناوری اطلاعات شرکت مخابرات از پروژه پوشش ۲۰ میلیون فیبر نوری وزارت ارتباطات / وزیر وعده غیرممکن داده است + به‌روزرسانی

افزایش سقف تراکنش درگاه‌های پرداخت اینترنتی و کارت‌خوان‌های تاپ به ۱۰۰ میلیون تومان

نماینده مجلس مدعی شد: پهنای باند روبیکا سه برابر استارلینک خواهد شد

عضو کمیسیون اقتصادی مجلس: قطع اینترنت جواب نمی‌دهد و فقط به تعداد بیکاران افزوده است

همکاری جدید اپل‌پی با شرکت گلدمن‌ساکس / اپل روزبه‌روز بیشتر شبیه یک بانک می‌شود

سامسونگ از سریع‌ترین DRAM LPDDR5X دنیا با سرعت 8.5 گیگابیت بر ثانیه رونمایی کرد

کارزار تبلیغاتی متا علیه iMessage اپل؛ مارک زاکربرگ: واتس‌اپ خیلی بهتر و ایمن‌تر است

وزیر ارتباطات: خسارت کسب‌وکارهای مجازی برعهده کسانی است که اغتشاش و آشوب به وجود آورده‌اند

گوشی اقتصادی آنر پلی 6C با نمایشگر 90 هرتزی و اسنپدراگون 480 معرفی شد

کوالکام احتمالا تامین‌کننده مودم 5G سری آیفون 15 و آیفون 16 باقی می‌ماند

ملی‌شدن اینترنت چه تأثیری بر شبکه پرداخت کشور دارد؟

عضو کمیته فیلترینگ: با پذیرش قوانین جمهوری اسلامی ایران فعالیت اینستاگرام و واتس‌اپ منعی ندارد

گزارش «راه پرداخت» از وضعیت کسب‌وکارهای فعال در اینستاگرام / ناامیدی و آینده نامعلوم؛ دغدغه امروز فعالان کسب‌وکارهای خرد

آیفون 14 پرو در بررسی DxOMark بالاترین امتیاز دوربین سلفی و فیلمبرداری را کسب کرد

هوش مصنوعی یک مسئله کوانتومی 100 هزار معادله‌‎ای را در 4 معادله خلاصه کرد

ریال یا ارز دیجیتال بانک مرکزی ایران، جهش ژنتیکی پرداخت ایران است

سامانه مدیریت هوشمند ناوگان ایرانسل، راهی برای نظارت بر ناوگان‌های پیچیده

شماره ۶۶ هفته‌نامه کارنگ و رمزارز شماره ۳۶ منتشر شد

رد توسعه‌دهندگان را چطور بزنیم؟

خدمات پیامک انبوه جیرینگ چه مزایایی برای مشتریان دارد؟

اپل ظاهرا در لحظه آخر تصمیم به استفاده از «جزیره پویا» در آیفون 14 پرو گرفته است

استفاده از API چه مزایایی برای شرکت‌های فین‌تک دارد؟

بنچمارک آنتوتو از افزایش 28 درصدی عملکرد گرافیکی تراشه A16 Bionic حکایت دارد

اینستاگرام ابزار جدید «Gifts» را برای کسب درآمد اینفلوئنسرها آزمایش می‌کند

طرح‌های مفهومی آیپد پرو با طراحی «جزیره پویا» آیفون 14 پرو را ببینید

بازگشت آنی وجه به حساب مشتری با سرویس استرداد وجه زیبال

چرا اپل از تولید آیفون 14 مینی منصرف شد؟

مدیر حوزه‌های علمیه: در تدوین سندهای راهبردی با موضوع هوش مصنوعی باید حضوری موثر داشته باشیم

هوش مصنوعی DALL-E حالا می‌تواند تصاویر را فراتر از کادر آن‌ها گسترش دهد [تماشا کنید]

خدمات فناورانه به زوار اربعین اعلام شد / وای‌فای رایگان در ۲۰ نقطه از مسیر نجف تا کربلا

جیرینگ در پنج عنوان شغلی استخدام می‌کند

افشای جزئیات جدیدی از سری آیفون 14؛ تراشه، رنگ‌بندی، رم و سرعت شارژ

اپل در تولید اولیه سری آیفون 14، روی مدل‌های پرو تمرکز کرده است

مجمع عمومی سالیانه رایتل برگزار شد؛ تداوم روند سودآوری

مدیر تیم بلاکچین نوبیتکس در رویداد CWS مکانیزم نگهداری دارایی کاربران این صرافی را تشریح کرد

دیوار: با سیستم تایید هویت در عرض ۶ ماه، آمار کاربران کلاهبردار را به طرز چشمگیری کاهش خواهیم داد

ساترا: تولیدات ویدیویی در فضای مجازی باید متناسب با فرهنگ اسلامی و قابل پخش در انواع رسانه‌ها باشد

سامسونگ ظاهرا روی نسل بعدی تراشه‌های تنسور گوگل کار می‌کند

مدیرعامل لندو از چشم‌انداز این شرکت در ارائه وام‌های خرد آنلاین می‌گوید / هدف؛ اولین‌شدن

لزوم رعایت نکات امنیتی در استفاده از خدمات بانکداری الکترونیک

سوپر اپلیکیشن ایرانسل من، پلی‌استیشن ۵ جایزه می‌دهد

بلومبرگ: اپل از سال آینده میلادی شروع به نمایش تبلیغات در اپ مپس می‌کند

تفاهم‌نامه‌ ایرانسل و اتحادیه تاکسیرانی‌های شهری کشور با تمرکز بر سیستم ارتباطی بی‌سیم تاکسی

اپلیکیشن‌های شیپور، شیپور پلاس و آلونک از گوگل‌پلی حذف شدند

اپل ظاهرا تولید نسل دهم آیپد را با تغییرات عمده در طراحی شروع کرده است

گزارش سالانه تریبون: رمزارز بیشترین تبلیغات در رسانه‌ها را به خود اختصاص داد

دانشمندان چینی رکورد قوی‌ترین میدان مغناطیسی یکنواخت جهان را شکستند

فناوری‌ها و پیشرفت‌های مهم شکل‌دهنده آینده فین‌تک

پروژکتور شیائومی می 2S با امکان نمایش تصویر 120 اینچی معرفی شد

مرحله جدید رگولاتوری سلامت دیجیتال: دانشگاه علوم پزشکی از استارتاپ هومکا شکایت کرد

مهندس سابق گوگل: هوش مصنوعی لمدا سوگیری‌های نژادی و مذهبی دارد

شماره شصتم هفته‌نامه کارنگ به همراه دو ضمیمه منتشر شد

طرح قانون یکپارچه‌سازی داده‌ها و اطلاعات ملی اصلاح شد / مرکز ملی تبادل اطلاعات وزارت ارتباطات عهده‌دار تبادل اطلاعات شد

این ابزار هوش مصنوعی رایگان عکس‌های قدیمی را احیا می‌کند

رونمایی از پلتفرم مارکت پلیس آرتانیوم؛ همراهی هنر و تکنولوژی در حوزه NFT

امکان دریافت درگاه پرداخت اینترنتی تجارت الکترونیک پارسیان همزمان با اینماد

مارک زاکربرگ: متا و اپل در یک رقابت عمیق فلسفی برای ساخت متاورس قرار دارند

آی‌تی‌ساز در نمایشگاه بورس،بانک و بیمه از محصولات جدید خود رونمایی می‌کند / از همکاری با بانک مسکن تا ایجاد نئوبانک

نگاهی به بیشترین عبارات جستجو شده در گوگل طی تیر ماه: کاربران به دنبال لغو محدودیت Safe Search

کالبدشکافی مک بوک ایر جدید، تراشه قدرتمند M2 را به تصویر می‌کشد

سامسونگ با انتشار یک پازل، تاریخ رویداد آنپکد بعدی خود را اعلام کرد

پیشنهاد سرمایه‌گذاری ۲۷ میلیارد تومانی در آی‌تی هاب

نگاهی به برترین پلتفرم‌های آموزش آنلاین کشور

در مسیر اینترنت کوانتومی؛ درهم‌تنیدگی دو اتم در فاصله 33 کیلومتری رکوردشکنی کرد

همین حالا مرورگر کروم خود را آپدیت کنید تا از یک آسیب‌‌‌‌پذیری خطرناک در امان بمانید

دیجی‌پی و بانک ملت برای ارائه اعتبار خرید اقساطی تفاهم‎نامه همکاری امضا کردند / اعطای تسهیلات خرد تا سقف ۳۰ میلیون تومان برای خرید اقساطی از دیجی‌کالا

مینگ-چی کو شایعات را رد کرد: اپل سفارشات تولید آیفون 14 را کاهش نمی‌دهد

پردازشگر گرافیکی Immortalis معرفی شد؛ اولین GPU آرم با رهگیری پرتو سخت‌افزاری

مدیر اپل سامسونگ را به کپی‌کاری متهم کرد: گلکسی‌ها همان آیفون با نمایشگر بزرگتر بودند

ضعف امنیت سایت‌های بانک‌های ایرانی عامل قطع دسترسی از خارج

اعلام شرایط ثبت گوشی تلفن همراه در فرودگاه امام خمینی

گزارش عملکرد سالانه نصر کشور: از رشد 66درصدی درآمد عملیاتی تا افزایش 6 درصدی اعضا

iOS 16 و مک او اس ونتورا برخی کپچاها را به‌طور خودکار رد می‌کنند

قطعی کلاودفلر بسیاری از سرویس‌های محبوب اینترنتی را از دسترس خارج کرد

سامسونگ احتمالا به‌زودی گوشی‌های اقتصادی گلکسی A04 و A04s را معرفی می‌کند

اولین پهپاد دنیا با قابلیت پرتاب از زیردریایی معرفی شد [تماشا کنید]

اعلام بخشی از مشخصات پوکو F4 5G: اسنپدراگون 870 و سیستم خنک‌کننده پیشرفته

اپل برای تسخیر صنعت خودروسازی در تلاش است

سامانه دفاعی چین ظاهرا می‌تواند مسیر موشک‌های هایپرسونیک را پیش‌بینی کند

با «ویپاد» آنلاین در بانک پاسارگاد، افتتاح حساب کنید و کارت بگیرید

مشخصات کامل گلکسی زد فلیپ 4 سامسونگ افشا شد

مشخصات کامل گوشی تاشو گلکسی زد فولد 4 افشا شد

احتمال معرفی هدست اپل در WWDC 2022 با ثبت علامت تجاری RealityOS

تلاش‌ها برای ممنوعیت واردات آیفون منجر به افزایش دو برابری واردات مسافری شد

سونی احتمالا از سال 2025 عرضه بازی‌های جدید برای پلی‌استیشن 4 را متوقف می‌کند

سامسونگ عملکرد سنسور دوربین 200 مگاپیکسلی خود را به رخ رقبا کشید [تماشا کنید]

سرویس Starlink for RVs معرفی شد؛ دسترسی به اینترنت در سفر با هزینه 135 دلار

مجله تایم فهرست 100 فرد تاثیرگذار سال 2022 را منتشر کرد

نحوه دریافت بیمه اقساطی در ازکی‌وام با سفته آنلاین چگونه است؟

ربات آلفا در غرفه انتشارات گرایش تازه در نمایشگاه کتاب چه می‌کند؟ / غرفه‌داری با هوش مصنوعی

آپدیت iOS 15.5 و iPadOS 15.5 منتشر شد؛ بررسی تغییرات

استقبال کاربران از اپلیکیشن پاس در نمایشگاه کتاب

نسخه 2022 تبلت گلکسی تب S6 لایت سامسونگ در سکوت خبری معرفی شد

هوش مصنوعی از صدا برای تشخیص افسردگی و اضطراب استفاده می‌کند

گزارش سالانه آی تی بازار از تحولات سال 1400

شکایت 1.28 میلیون دلاری روسیه از اپل به دلیل تعلیق خدمات Apple Pay

گام نهایی گرانی اینترنت کلید خورد / اینترنت سیم‌کارت چقدر گران می‌شود؟

پوکو F4 GT با اسنپدراگون 8 نسل یک و فناوری شارژ فوق سریع 120 واتی معرفی شد

سال 1401؛ زمان کلیدی برای توسعه زیرساخت‌های فناوری اطلاعات

گفت‌و‌گویی صریح و بی‌پرده با پویا پیرحسینلو، هم‌بنیان‌گذار و مدیرعامل ابرآروان / چرا سیبل شدیم؟

میرسلیم: افزایش غیرمنطقی قیمت اینترنت در مجلس پیگیری می‌شود

انجام فرآیندهای مربوط به چک‌های جدید از طریق پیامک

صنعت بیمه به دی‌ان‌ای نوآوری خاص خودش نیاز دارد / آفت کپی‌برداری از موفقیت دیگران

اندروید 13 زمان بارگذاری بازی‌ها را تا حد زیادی کاهش می‌دهد

ثبت نام و پرداخت آزمون‌های خارجی در سایت اول‌پرداخت

ببینید| پرداخت با رمز ارز‌ها خط قرمز قوانین پولی و بانکی کشور است

دیجی‌کالا پلتفرم محتوایی «مگنت» را معرفی کرد

سامسونگ احتمالا بتای عمومی اندروید 13 و One UI 5.0 را اواسط تابستان منتشر می‌کند

مکالمه نامحدود با 5 مشترک در طرح رمضان همراه اول

هدایای ایرانسل برای ماه رمضان اعلام شد

نگاهی به گزارش عملکرد سالانه آی‌قصه؛ بیش از 150 نیروی انسانی در خدمت قصه‌گویی برای بچه‌ها

عملکرد ضعیف نمایشگر گلکسی S22 در تست سقوط [تماشا کنید]

آرپا؛ رسانه پرداخت الکترونیک ایران راه‌اندازی شد

سامانه هوشمند رسیدگی به شکایات از کسب‌وکارهای اینترنتی رونمایی شد / امکان داوری جمعی برخط به وقوع پیوست

مدیرعامل مخابرات افزایش حق‌السهم اپراتورها به دولت را خطایی راهبردی عنوان کرد

Airbnb تمامی فعالیت‌های خود را در روسیه و بلاروس به حالت تعلیق درآورد

رگولاتوری: درآمد اپراتورهای همراه ۵۰ هزار میلیارد تومان نیست

تأکید دولت بر ارائه اینترنت با کیفیت و پرسرعت به مردم / افزایش ۳۰۰ گیگابایت پهنای باند به ظرفیت شرکت مخابرات

مذاکرات و رایزنی‌های ۱۰۰ سرمایه‌گذار خارجی با شرکت‌های دانش بنیان‌ ایرانی

اپلیکیشن شبکه اجتماعی Truth Social ترامپ در اپ استور منتشر شد

نتیجه یک مطالعه: اپل واچ افراد را تا 35 درصد فعال‌تر کرده است

ورود اولین مجموعه استارت‌آپی به بورس در چه مرحله‌ای است: آیا تپسی تا سه ماه دیگر عرضه اولیه خواهد شد؟

قدردانی سخنگوی دولت از همراه اول برای توسعه پلتفرم‌های دیجیتال

موج جدید هک عمومی با استفاده از شبکه وای‌فای هتل‌ها

رابط کاربری اسکایپ با حذف Hightlights ساده شد

هواوی از سه تبلت جدید در نمایشگاه MWC 2018 رونمایی خواهد کرد

دیدگاه «محمدحسین برخوردار» نسبت به حمایت دولت از استارتاپ‌ها

0

کردی، لری، بلوچی، لکی و گیلکی؛ زبان‌هایی که در عصر هوش مصنوعی برای بقا به داده نیاز دارند

تصویر پیدا نشد !
بازدید 1

کردی، لری، بلوچی، لکی و گیلکی؛ زبان‌هایی که در عصر هوش مصنوعی برای بقا به داده نیاز دارند

بسیاری از زبان‌های ایرانی با وجود میلیون‌ها گویشور، هنوز زیرساخت لازم برای ورود به مدل‌های هوش مصنوعی را ندارند. این موضوع از یک چالش فرهنگی فراتر رفته و به موضوعی درباره آینده فناوری تبدیل شده است.

به گزارش پیوست، زبان‌هایی می‌توانند وارد مدل‌های هوش مصنوعی شوند که مجموعه‌ای از منابع فنی مانند پیکره‌های متنی، داده‌های گفتاری، فرهنگ لغت دیجیتال و منابع آموزشی را داشته باشند. فقدان این زیرساخت‌ها باعث می‌شود یک زبان زنده، در محیط‌های جدید فناوری حضور محدودی داشته باشد.

پردازش زبان طبیعی (NLP) بر پایه یادگیری از داده‌های زبانی عمل می‌کند. مدل‌های زبانی بزرگ مانند GPT و BERT با تحلیل حجم گسترده‌ای از متن، الگوهای واژگانی، نحوی و معنایی زبان را استخراج می‌کنند. با این حال، پژوهش‌های حوزه تعامل انسان و ماشین نشان می‌دهد که توانایی تولید متن الزاما به معنای درک کامل زبان نیست. این مساله برای زبان‌هایی که منابع دیجیتال محدودتری دارند، پیچیده‌تر است زیرا داده کافی برای ساخت مدل، ارزیابی عملکرد و توسعه ابزارهای کاربردی وجود ندارد.

بر اساس برآوردهای موجود، زبان فارسی با حدود ۵۰.۴ میلیون گویشور، بزرگ‌ترین زبان ایرانی است. در کنار آن، کردی با حدود ۵.۵۹ میلیون، گیلکی با حدود ۲.۴ میلیون، مازندرانی با حدود ۲.۳۴ میلیون، بلوچی با حدود ۱.۹۲ میلیون، لری با حدود ۱.۷ میلیون و لکی با حدود یک میلیون گویشور قرار دارند. فاصله میان این زبان‌ها اما در حوزه فناوری زبان، بسیار بیشتر از فاصله جمعیتی آنهاست.

داده مناسب برای آموزش ماشین وجود ندارد

دیجیتال یک زبان به میزان «قابل پردازش بودن» آن وابسته شده است. زبان‌هایی که دارای منابع ساختاریافته هستند، می‌توانند سریع‌تر وارد ابزارهایی مانند ترجمه ماشینی، دستیارهای صوتی، موتورهای جست‌وجو و سامانه‌های آموزشی هوشمند شوند.

مطالعات حوزه پردازش زبان طبیعی نشان می‌دهد که عملکرد مدل‌ها به شدت تحت تأثیر حجم و کیفیت داده آموزشی قرار دارد. تفاوت عملکرد میان زبان‌ها در مطالعات تجربی نیز مشاهده شده است. در یک مطالعه مشخص شد عملکرد مدل‌ها برای زبان انگلیسی ۸۸ درصد، اسپانیایی ۶۲ درصد، ماندارین ۵۸ درصد و عربی ۵۴ درصد بوده است. این اعداد نشان می‌دهند کیفیت عملکرد AI میان زبان‌ها یکسان نیست. در نتیجه، داشتن جمعیت بزرگ به تنهایی تضمین‌کننده حضور یک زبان در فناوری نیست.

ایران فقط فارسی نیست

زبان‌های ایرانی یکی از شاخه‌های خانواده بزرگ هندواروپایی هستند که زبان‌هایی مانند فارسی، کردی، بلوچی، لری، گیلکی و بسیاری دیگر در این گروه قرار می‌گیرند. همان‌طور که زبان‌های فرانسوی، اسپانیایی و ایتالیایی با وجود تعلق به کشورهای مختلف، در خانواده زبان‌های رومی دسته‌بندی می‌شوند.

زبان‌های ایرانی در زبان‌شناسی معمولا به دو شاخه اصلی ایرانی غربی و ایرانی شرقی تقسیم می‌شوند. این تقسیم‌بندی بر اساس ویژگی‌های تاریخی، آوایی و دستوری زبان‌ها شکل گرفته و ارتباط مستقیمی با مرزهای سیاسی امروز ندارد. برای نمونه کردی در ایران، عراق، ترکیه و سوریه، بلوچی در ایران، پاکستان و افغانستان و فارسی در ایران، افغانستان و تاجیکستان کاربرد دارد. از سوی دیگر، همه زبان‌هایی که در داخل مرزهای ایران امروز استفاده می‌شوند الزاما از خانواده زبان‌های ایرانی نیستند؛ برای مثال زبان‌های ترکی، عربی و برخی زبان‌های دیگر نیز در ایران رواج دارند اما از نظر زبان‌شناختی در خانواده‌های دیگری قرار می‌گیرند.

تجربه زبان فارسی برای ورود به AI

در میان زبان‌های ایرانی، فارسی بیشترین فاصله را از سایر زبان‌ها در حوزه زیرساخت دیجیتال دارد. این تفاوت نتیجه انباشت چند دهه تولید محتوای دیجیتال، فعالیت دانشگاهی، توسعه نرم‌افزارهای زبانی و ایجاد مجموعه داده‌های پردازشی است.

فارسی دارای مجموعه‌هایی مانند ParsBERT و FarsTail و همچنین منابع گفتاری مانند DeepMine است. دیتاست DeepMine یکی از نمونه‌های مهم زیرساخت داده برای فارسی است که شامل بیش از ۱۸۵۰ گوینده، حدود ۵۴۰ هزار فایل صوتی و بیش از ۴۸۰ ساعت داده گفتاری رونویسی‌شده است. تجربه فارسی نشان می‌دهد حتی یک زبان با ده‌ها میلیون کاربر نیز برای ورود به فناوری هوش مصنوعی به سرمایه‌گذاری گسترده در تولید داده نیاز دارد.

کردی با چالش فنی و پراکندگی داده

کردی یکی از مهم‌ترین زبان‌های ایرانی از نظر تعداد گویشور و گستره جغرافیایی است. این زبان در ایران، عراق، ترکیه و سوریه استفاده می‌شود و گونه‌های اصلی آن شامل کرمانجی، سورانی و دیگر گونه‌های منطقه‌ای است. با وجود جمعیت قابل توجه گویشوران، وضعیت منابع فناوری زبان کردی با زبان‌های بزرگ جهانی فاصله زیادی دارد.

یکی از شاخص‌های قابل اندازه‌گیری این فاصله، حجم منابع زبانی موجود برای پردازش رایانه‌ای است. برای نمونه، یک پیکره پژوهشی برای کردی سورانی شامل ۳۱ کتاب آموزشی، حدود ۶۹۳ هزار توکن و ۱۱۰ هزار واژه متمایز ایجاد شده است. این حجم داده برای توسعه ابزارهای پایه NLP ارزشمند است، اما در مقایسه با منابعی که برای زبان‌های اصلی فناوری وجود دارد، همچنان محدود محسوب می‌شود.

یکی از چالش‌های مهم کردی، مساله تنوع گونه‌ها و خط نوشتاری است. کردی کرمانجی عمدتا با خط لاتین نوشته می‌شود، در حالی که کردی سورانی از خط عربی اصلاح‌شده استفاده می‌کند. این تفاوت باعث می‌شود داده‌های زبانی در چند مسیر جداگانه تولید شوند و ایجاد مدل‌های یکپارچه دشوارتر شود.

ترکی آذری و تبدیل حضور اجتماعی به حضور دیجیتال

ترکی آذری یکی از پرگویشورترین زبان‌های مورد استفاده در ایران است و به دلیل جمعیت گسترده گویشوران، از نظر تولید محتوای فرهنگی و رسانه‌ای وضعیت متفاوتی با بسیاری از زبان‌های محلی ایران دارد.

ترکی آذری در مقایسه با بسیاری از زبان‌های کوچک‌تر ایران منابع دیجیتال بیشتری دارد، اما همچنان با فاصله قابل توجهی نسبت به زبان‌های اصلی فناوری مانند انگلیسی، فارسی یا ترکی استانبولی مواجه است. تفاوت‌ میان گونه‌های مختلف ترکی، تفاوت در خط و پراکندگی منابع میان کشورهای مختلف، از چالش‌های توسعه مدل‌های زبانی برای این زبان است. وضعیت ترکی آذری نشان می‌دهد که حتی زبان‌هایی با میلیون‌ها گویشور نیز بدون سرمایه‌گذاری در ایجاد داده و زیرساخت NLP نمی‌توانند به شکل کامل در فناوری‌های هوش مصنوعی، از ترجمه ماشینی تا دستیارهای صوتی، حضور پیدا کنند.

بلوچی نمونه یک زبان زنده بدون زیرساخت فناورانه

بلوچی یکی از زبان‌های ایرانی با گستره جغرافیایی وسیع است که در ایران، پاکستان و افغانستان استفاده می‌شود. برآوردها تعداد گویشوران آن را حدود ۸ تا ۱۰ میلیون نفر اعلام می‌کنند. با این حال، میزان توسعه منابع دیجیتال و ابزارهای پردازش زبان بلوچی با اندازه جامعه زبانی آن تناسب ندارد.

یکی از مسائل اصلی بلوچی، وضعیت منابع نوشتاری و استانداردسازی است. این زبان در مناطق مختلف با شیوه‌های نوشتاری متفاوتی استفاده می‌شود و بخشی از محتوای آن در قالب‌های غیرساختاریافته قرار دارد. برای توسعه مدل‌های زبانی، صرف وجود متن کافی نیست؛ داده‌ها باید قابل پردازش، دسته‌بندی و استانداردسازی باشند.

وضعیت بلوچی نمونه‌ای از یک مساله گسترده‌تر در زبان‌های کم‌منبع است یعنی جامعه زبانی ممکن است بزرگ باشد، اما اگر داده‌های دیجیتال قابل استفاده تولید نشده باشد، این زبان در چرخه توسعه فناوری حضور محدودی خواهد داشت.

گیلکی و مازندرانی؛ حلقه مفقوده داده در ادبیات محلی

گیلکی و مازندرانی از زبان‌های ایرانی شمالی هستند که هر کدام میلیون‌ها گویشور دارند. این زبان‌ها دارای سابقه ادبی، فرهنگی و شفاهی گسترده‌ای هستند، اما بخش مهمی از این میراث در قالب منابع دیجیتال استاندارد برای فناوری زبان ثبت نشده است.

بخش قابل توجهی از داده‌های این زبان‌ها در قالب گفت‌وگوهای روزمره، موسیقی، ادبیات شفاهی و محتوای شبکه‌های اجتماعی وجود دارد. این نوع داده برای جامعه انسانی قابل استفاده است، اما برای آموزش مدل‌های هوش مصنوعی نیازمند تبدیل به مجموعه داده‌های ساختاریافته، برچسب‌گذاری و پردازش است.

تفاوت میان «وجود داده» و «وجود داده قابل استفاده برای AI» یکی از مهم‌ترین شکاف‌های این حوزه است. یک زبان ممکن است در جامعه فعال باشد، اما در سامانه‌های تشخیص گفتار، ترجمه ماشینی یا مدل‌های زبانی حضور نداشته باشد.

لری و لکی؛ زبان‌هایی با میراث شفاهی گسترده

لری و لکی نمونه‌هایی از زبان‌های ایرانی هستند که بخش قابل توجهی از کاربرد روزمره آنها در حوزه گفتار اتفاق می‌افتد. برآوردها تعداد گویشوران لری را چند میلیون نفر و لکی را حدود یک تا دو میلیون نفر اعلام می‌کنند، اما منابع دیجیتال آنها نسبت به جمعیتشان محدود است.

یکی از چالش‌های اصلی این زبان‌ها، نبود استاندارد نوشتاری فراگیر و وابستگی بخش زیادی از محتوای مکتوب به خط فارسی است. برای مدل‌های هوش مصنوعی، تشخیص تفاوت میان فارسی و گونه‌های نزدیک زبانی یا تشخیص ویژگی‌های مستقل یک زبان، نیازمند داده آموزشی کافی است. نبود چنین داده‌هایی باعث می‌شود بخش مهمی از تنوع زبانی در داده‌های آموزشی مدل‌ها ناپدید شود.

ماشین‌ها فقط واژه‌ها را یاد می‌گیرند

حتی افزایش حجم داده به تنهایی مساله را حل نمی‌کند. زبان یک سیستم صرفا واژگانی نیست؛ معنا در بسیاری از موارد به زمینه اجتماعی، رابطه میان افراد، لحن و دانش فرهنگی وابسته است.

مطالعات انجام‌شده درباره چت‌بات‌های هوش مصنوعی نشان می‌دهد مدل‌ها در تولید متن منسجم، ساختار دستوری و سازمان‌دهی اطلاعات عملکرد بالایی دارند، اما در حوزه‌هایی مانند سازگاری با زمینه، درک نشانه‌های اجتماعی و تولید زبان طبیعی مشابه انسان محدودیت دارند. مرور ۱۵ مطالعه درباره الگوهای زبانی چت‌بات‌ها نشان می‌دهد پاسخ‌های AI معمولا از نظر ساختاری منسجم هستند، اما در عمق عاطفی و سازگاری ضعف دارند.

این مساله برای زبان‌های محلی اهمیت بیشتری دارد، زیرا بخش قابل توجهی از معنای آنها در عناصر غیررسمی زبان، اصطلاحات، ضرب‌المثل‌ها و کاربردهای اجتماعی شکل می‌گیرد. پژوهش‌های حوزه تعامل انسان و ماشین نشان می‌دهند سیستم‌های فعلی در تشخیص کنایه، طنز، عبارات اصطلاحی و معانی غیرمستقیم همچنان با مشکل مواجه‌اند.

بنابراین چالش زبان‌های ایرانی در عصر AI فقط این نیست که آیا متنی به این زبان‌ها وجود دارد یا نه؛ مساله این است که آیا داده موجود می‌تواند ویژگی‌های واقعی آن زبان را به ماشین منتقل کند یا خیر.

AI و خطر شکل‌گیری شهروندان درجه دو زبانی

بسیاری از تعاملات آینده میان شهروندان و ابزارهای فناورانه، از آموزش شخصی‌سازی‌شده و دستیارهای هوشمند تا خدمات عمومی و سامانه‌های سلامت از طریق زبان انجام خواهد شد. در چنین شرایطی، مساله زبان‌های کم‌منبع صرفا یک موضوع فرهنگی یا میراثی نیست. اگر یک زبان در سامانه‌های هوشمند حضور نداشته باشد، کاربران آن زبان در بسیاری از کاربردهای آینده ناچار خواهند بود از زبان دیگری استفاده کنند.

ورود زبان‌های ایرانی به عصر هوش مصنوعی نیازمند ایجاد زیرساخت داده است. تجربه زبان‌هایی که در سال‌های اخیر توانسته‌اند وارد ابزارهای دیجیتال شوند، نشان می‌دهد نخستین مرحله نه ساخت مدل‌های بزرگ، بلکه جمع‌آوری و سازمان‌دهی داده است.

برای زبان‌های ایرانی، ایجاد پیکره‌های متنی، ثبت داده‌های صوتی، دیجیتال‌سازی کتاب‌ها و منابع دانشگاهی، ایجاد فرهنگ‌های لغت دیجیتال و جمع‌آوری نمونه‌های گفتاری می‌تواند پایه توسعه ابزارهای آینده باشد. بسیاری از زبان‌های محلی ایران منابع فرهنگی و شفاهی گسترده‌ای دارند، اما این منابع هنوز به شکل داده قابل استفاده برای مدل‌های هوش مصنوعی تبدیل نشده‌اند.

بانک داده زبان‌های ایران و اولویت حکمرانی AI

در ایران، مساله اصلی فقط کمبود ابزارهای هوش مصنوعی نیست؛ پیش از آن، کمبود داده‌های استاندارد درباره بخشی از زبان‌های موجود کشور است. بدون ایجاد سازوکار مشخص برای جمع‌آوری، نگهداری و دسترس‌پذیر کردن داده‌های زبانی، توسعه فناوری برای بسیاری از زبان‌های ایرانی به پروژه‌های پراکنده و محدود باقی خواهد ماند.

در عصر AI، تنوع زبانی زمانی می‌تواند حفظ شود که از مرحله میراث فرهنگی عبور کند و به عنوان بخشی از زیرساخت فناوری کشور دیده شود. زبان‌هایی که امروز داده دیجیتال ندارند، ممکن است فردا در مهم‌ترین لایه‌های ارتباط انسان و ماشین حضور نداشته باشند.

مقاله اصلی

نظرات کاربران

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

مشاهده بیشتر