در چشمانداز سریعاً در حال تحول مدلهای زبانی بزرگ (LLMs)، انتشار سری Yi هیجان زیادی را در میان توسعهدهندگان و محققان ایجاد کرده است. Yi که توسط 01.ai (که پیشتر با نام فناوری لیانژی شناخته میشد) توسعه یافته است، نقطه عطفی در جامعه هوش مصنوعی متنباز محسوب میشود. برخلاف بسیاری از مدلهای اختصاصی، Yi معماریهای با عملکرد بالا را ارائه میدهد که کاملاً وزنهای باز (open-weight) دارند و این امر شفافیت، قابلیت سفارشیسازی و انعطافپذیری گسترده در استقرار را امکانپذیر میسازد. این پست به بررسی زیرساختهای فنی Yi، قابلیتهای دوزبانه منحصربهفرد آن و نحوه استفاده توسعهدهندگان از آن در محیطهای عملیاتی میپردازد.
معماری و دادههای آموزشی
خانواده مدلهای Yi بر پایه یک معماری ترانسفورمر (Transformer) مستحکم ساخته شده است که برای کارایی و مقیاسپذیری بهینهسازی شده است. آنچه Yi را از همنسلان خود متمایز میکند، روش آموزش سختگیرانه آن است. این مدلها بر روی یک کورپوس عظیم از دادههای متنی پیشآموزش دیدهاند، با تأکید ویژه بر محتوای باکیفیت و بدون تکرار. این رویکرد اطمینان حاصل میکند که مدل مشکل «ورودی بیکیفیت، خروجی بیکیفیت» را که اغلب در مجموعهدادههای کمتر پالایششده دیده میشود، به حداقل میرساند.
یکی از جذابترین ویژگیهای Yi، تسلط دوزبانه آن به زبانهای انگلیسی و چینی است. دادههای آموزشی با دقت برای تعادل بین این دو زبان گردآوری شدهاند که به مدل اجازه میدهد در معیارهای ارزیابی (benchmarks) در هر دو حوزه زبانی بهطور رقابتی عملکرد داشته باشد. این امر Yi را به گزینهای ایدهآل برای کاربردهایی تبدیل میکند که بازارهای جهانی را هدف قرار میدهند، بهویژه در مراکز فناوری که پشتیبانی چندزبانه یک نیاز حیاتی است.
اندازهها و انواع مدل
01.ai چندین نسخه از مدل Yi را منتشر کرده است که برای رفع محدودیتهای محاسباتی و نیازهای عملکردی مختلف طراحی شدهاند. این مجموعه معمولاً شامل موارد زیر است:
- Yi-6B: یک مدل فشرده که برای دستگاههای لبهای (edge devices) و کاربردهای حساس به هزینه مناسب است.
- Yi-34B: یک مدل میاناندازه قدرتمند که تعادلی عالی بین عملکرد و مصرف منابع ارائه میدهد.
- Yi-34B-200K: یک نسخه با پنجره زمینه (context window) گستردهتر که قادر به پردازش اسناد طولانی است و برای وظایف تحلیل و خلاصهسازی اسناد حیاتی میباشد.
پیادهسازی عملی با هگینگ فیس
برای توسعهدهندگانی که به دنبال یکپارچهسازی Yi در گردش کارهای خود هستند، کتابخانه transformers هگینگ فیس (Hugging Face) پشتیبانی بینقصی را فراهم میکند. در زیر یک مثال عملی از نحوه بارگذاری و اجرای استنتاج (inference) با یک مدل Yi با استفاده از پایتون آورده شده است.
from transformers import AutoModelForCausalLM, AutoTokenizer
# بارگذاری توکنساز و مدل Yi
model_name = "01-ai/Yi-6B"
tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="auto",
trust_remote_code=True
)
# آمادهسازی متن ورودی
text = "متن انگلیسی زیر را به چینی ترجمه کنید: 'Artificial intelligence is transforming the world.'"
inputs = tokenizer(text, return_tensors="pt").to(model.device)
# تولید خروجی
outputs = model.generate(**inputs, max_new_tokens=50)
result = tokenizer.decode(outputs[0], skip_special_tokens=True)
print(result)
این قطعه کد سادگی استقرار Yi را نشان میدهد. با بهرهگیری از device_map="auto"، کتابخانه بهطور خودکار تخصیص حافظه GPU را مدیریت میکند و این کار را برای توسعهدهندگان حتی بر روی سختافزارهایی با حافظه ویدیویی (VRAM) محدود، آسانتر میسازد.
موارد استفاده و عملکرد
Yi عملکرد استثنایی خود را در معیارهای ارزیابی مختلفی از جمله HumanEval برای وظایف کدنویسی و MMLU برای دانش عمومی نشان داده است. توانایی آن در درک و تولید کد به زبانهای متعدد، آن را بهویژه برای ابزارهای توسعهدهندگان ارزشمند میسازد. علاوه بر این، قدرت دوزبانه آن به آن اجازه میدهد به عنوان پلی در پلتفرمهای ارتباطی بینفرهنگی عمل کند و ترجمههای دقیقی ارائه دهد که ظرافت و زمینه را حفظ میکنند.
نتیجهگیری
مدلهای Yi از 01.ai نشاندهنده پیشرفت قابل توجهی در فناوری مدلهای زبانی بزرگ متنباز هستند. با قابلیتهای دوزبانه قوی، معماری کارآمد و مجوزهای وزنهای باز، آنها ابزاری چندمنظوره را برای طیف وسیعی از کاربردها در اختیار توسعهدهندگان قرار میدهند. چه در حال ساخت چتباتهای چندزبانه، دستیاران کدنویسی یا تحلیلگران اسناد باشید، Yi عملکرد و انعطافپذیری مورد نیاز برای موفقیت در چشمانداز هوش مصنوعی مدرن را ارائه میدهد. با ادامه رشد اکوسیستم هوش مصنوعی متنباز، Yi به عنوان بازیگری کلیدی برجسته میشود و به توسعهدهندگان توانایی ساخت نسل بعدی برنامههای هوشمند را میدهد.