Category

Open Models

Llama Qwen DeepSeek Gemma Mistral Phi Falcon Yi Mixtral

33 posts

DeepSeek Coder: راهنمای فنی برای تنظیم دقیق (Fine-Tuning) در وظایف توسعه نرم‌افزار

زمینه مدل‌های زبانی بزرگ (LLMs) به سرعت از دستیارهای همه‌منظور به ابزارهای مهندسی با عملکرد بالا و تخصصی تغییر می‌کند. در میان مدل‌های متن‌باز جذاب در این حوزه، DeepSeek Coder قرار دارد. این مدل که بر روی مجموعه داده‌ای عظیم از کد و زبان طبیعی آموزش دیده است، در وظایف تولید کد، عیب‌یابی و تکمیل کد با مدل‌های انحصاری رقابت می‌کند. با این حال، برای کاربردهای سازمانی که به منطق خاص حوزه، نحو (syntax) انحصاری یا پایبندی سخت‌گیرانه به استانداردهای کدنویسی داخلی نیاز دارند، عملکرد آماده اغلب ناکافی است. این راهنما یک مرور فنی جامع برای تنظیم دقیق DeepSeek Coder جهت برآورده کردن نیازهای سخت‌گیرانه توسعه نرم‌افزار مدرن ارائه می‌دهد.

فالکون: قدرتمند متن‌باز که غول‌های انحصاری را به چالش می‌کشد

در چشم‌انداز سریع در حال تحول مدل‌های زبانی بزرگ (LLMs)، رقابت عمدتاً توسط غول‌های منبع‌بسته مانند GPT-4 و کلادو کنترل می‌شود. با این حال، جنبش متن‌باز رقبای قدرتمندی تولید کرده است، با خانواده فالکون از مؤسسه نوآوری فناوری (TII)...

فراتر از هیاهو: راهنمای توسعه‌دهندگان برای استقرار و تنظیم دقیق Llama

انتشار سری مدل‌های Llama متا (Large Language Model Meta AI) نقطه عطفی در منظر هوش مصنوعی بود. با باز کردن سورس مدل‌های پایه با عملکرد بالا، متا دسترسی به مدل‌های زبانی بزرگ (LLM) پیشرفته را دموکراتیک کرد و به توسعه‌دهندگان، محققان و سازمان‌ها امکان داد تا مدل‌ها را بدون هزینه‌های سرسام‌آور APIهای اختصاصی بسازند، تنظیم دقیق کنند و مستقر نمایند.

غلبه بر محدودیت‌های سخت‌افزار مصرفی برای مدل Llama 3.1 8B: بررسی عمیق کم‌تراشی و عملکرد

انتشار مدل Llama 3.1 8B متا، ورود به دنیای مدل‌های زبانی بزرگ (LLM) را تسهیل کرده است. اما اجرای کارآمد آن‌ها بر روی سخت‌افزارهای معمولی همچنان چالش‌برانگیز است. این مقاله راهکارهای کم‌تراشی را برای بهینه‌سازی مصرف حافظه بررسی می‌کند.

گشودن مکالمات در سطح سازمانی: نگاهی عمیق به مدل متن‌باز Starling-7B

در چشم‌انداز به‌سرعت در حال تحول مدل‌های زبانی بزرگ (LLM)، شکاف بین غول‌های اختصاصی و جایگزین‌های متن‌باز به‌طور قابل‌توجهی کاهش یافته است. Starling-7B، مدلی با ۷ میلیارد پارامتر که توسط LMSYS Org توسعه یافته، وارد میدان می‌شود. برخلاف مدل‌های سنتی...

تسلط بر Stable Diffusion XL: راهنمای توسعه‌دهندگان برای نسل بعدی تولید تصویر متن‌باز

در چشم‌انداز به‌سرعت در حال تحول هوش مصنوعی، مدل‌های کمی توانسته‌اند به اندازه Stable Diffusion تخیل توسعه‌دهندگان و خلاق‌ها را برانگیزند. Stable Diffusion XL (SDXL) که توسط Stability AI منتشر شده، جهش قابل‌توجهی در قابلیت‌های تولید تصویر از متن است...

تسلط بر RAG سازمانی: نگاهی عمیق به Command R شرکت Cohere

مدل‌های زبانی بزرگ (LLMs) به سرعت از تولیدکنندگان متن ساده به عامل‌های قدرتمندی برای استدلال پیچیده تبدیل شده‌اند. با این حال، برای کاربردهای سازمانی، دو نقطه دردناک همچنان حیاتی هستند: توهم در پایپ‌لاین‌های تولید تقویت‌شده با بازیابی (RAG) و توانایی تعامل با ابزارهای خارجی.