rawabi

424 posts

rawabi banner
rawabi

rawabi

@ira__70

AI/ML Engineer

Kingdom of Saudi Arabia Katılım Şubat 2019
188 Takip Edilen242 Takipçiler
rawabi
rawabi@ira__70·
أداة جديدة اسمها Global Researcher Map
تقدر تبحث عن أي باحث او موضوع وتشوف مين وراء أبرز الأبحاث في الذكاء الاصطناعي فكرة تستاهل التجربة لو تتابع أبحاث الـ AI الرابط alphaxiv.org/researchers/map
العربية
0
1
2
189
rawabi retweetledi
Saad
Saad@Sa4d_k1·
من أكثر الأوراق البحثية انتشارًا في مجتمع الذكاء الاصطناعي هذا الشهر ورقة تتحدث عن نقطة بسيطة وسهلة، لكنها قد تؤثر بشكل كبير على أداء النماذج اللغوية، ليس فقط في كتابة الـ Prompts، بل أيضًا في توليد البيانات، تدريب النماذج، الترجمة، وحتى بناء وكلاء الذكاء الاصطناعي. الفكرة باختصار: - ليس فقط “ماذا” نسأل النموذج، بل “كيف” نصيغ السؤال (Prompt) لفترة طويلة كان التركيز في تحسين النماذج يدور حول حجم البيانات، جودة البيانات، حجم النموذج، وطريقة التدريب. لكن هذه الورقة تطرح زاوية مختلفة مرتبطة بمرحلة ما قبل التدريب (Pre-training): النماذج تتعلم من أنماط لغوية تتكرر أمامها بكثرة، لذلك قد تكون بعض الصياغات أسهل عليها من صياغات أخرى حتى لو كان المعنى واحدًا. والتحدي هنا أن كثيرًا من النماذج القوية مغلقة المصدر، ولا نعرف بدقة ما هي البيانات التي تدرّبت عليها. لذلك تقترح الورقة تقدير “شيوع الصياغة” من مصادر نصية مفتوحة على الإنترنت، ثم اختيار الصياغة الأقرب للأنماط اللغوية الشائعة عنوان الورقة: Adam’s Law: Textual Frequency Law on Large Language Models فكرة الورقة بشكل مباشر: إذا كان عندك جملتان تحملان نفس المعنى، غالبًا النموذج يتعامل بشكل أفضل مع الجملة الأكثر شيوعًا واستخدامًا في النصوص؛ لأنها أقرب للأنماط التي شاهدها النموذج كثيرًا أثناء التدريب. مثال مبسّط من الحياة اليومية: بدلًا من: "أرغب في معرفة الخيارات الغذائية المناسبة التي يمكن تناولها في فترة المساء دون أن تسبب شعورًا بالثقل قبل النوم" الأفضل: "وش أقدر أتعشى الليلة بدون ما أحس بثقل قبل النوم؟" المعنى متقارب، لكن الصياغة الثانية أقرب للطريقة الطبيعية التي نستخدمها في السؤال اليومي، وغالبًا أقرب أيضًا إلى الأنماط اللغوية التي شاهدها النموذج بكثرة أثناء التدريب، مما قد يجعل إجابته أفضل. لا يكفي أن تكون الجملة صحيحة من ناحية المعنى، بل من المهم أيضًا أن تكون طبيعية، واضحة، وقريبة من الاستخدام الشائع الورقة لم تكتفِ بالفكرة نظريًا، بل اختبرتها على عدة نماذج قوية مثل: - GPT-4o-mini - DeepSeek-V3 - Llama 3.3 70B - Qwen 2.5 7B - Doubao 1.5 والاختبارات لم تكن على مهمة واحدة فقط، بل شملت حل المسائل، الترجمة، الاستدلال العام، وتجارب Fine-tuning. ومن الأفكار المهمة في الورقة أيضًا ما يسمونه: Curriculum Textual Frequency Training - CTFT وفكرته باختصار: بدل أن ندرّب النموذج على البيانات بترتيب عشوائي، يتم ترتيب بيانات التدريب حسب شيوع الصياغة، من الأقل شيوعًا إلى الأكثر شيوعًا، بحيث يستفيد النموذج من تنوع الصياغات الأقل شيوعًا في البداية، ثم ينهي التدريب بصياغات أقرب للأنماط المألوفة والشائعة. في تجارب الـ Fine-tuning، طبّقوا ذلك على Qwen2.5-7B-Instruct باستخدام LoRA، ووجدوا أن ترتيب البيانات بهذه الطريقة ساعد في تحسين نتائج الترجمة مقارنة بعدة طرق أخرى. الورقة تقترح فكرة مهمة في التعامل مع النماذج اللغوية: أحيانًا تحسين الأداء لا يبدأ من تغيير النموذج، بل من تحسين اللغة التي نخاطب بها النموذج، أو اللغة التي ندرّبه ونقيّمه عليها بمعنى آخر قبل أن نحكم أن النموذج ضعيف، قد نحتاج أن نسأل أولًا: هل صغنا السؤال أو البيانات بلغة يفهمها النموذج بسهولة؟ أنصح بالاطلاع على الورقة، لأنها تحتوي على تفاصيل إضافية وتجارب أوسع حول الفكرة ونتائجها. الورقة: arxiv.org/pdf/2604.02176 الكود: github.com/HongyuanLuke/f…
Saad tweet media
العربية
1
8
99
16.5K
rawabi
rawabi@ira__70·
بناء أول MCP Server تجربة تقنية ممتعة ومختلفة ببساطة هذا البروتوكول هو الجسر اللي يخلي النماذج اللغوية LLMs تتواصل مع بياناتك وأدواتك الخاصة بشكل مباشر وآمن. مكتبة FastMCP تختصر عليك تعقيدات الكود وتخليك تبني Tools وتعرفها في دقائق.
العربية
0
0
1
61
rawabi
rawabi@ira__70·
وبعد التدريب ينفذ وظيفتين أساسيتين: التشفير (encode()) من النصوص إلى وحدات نصية وفك التشفير (decode()) من الوحدات النصية إلى النصوص
العربية
0
0
0
43
rawabi
rawabi@ira__70·
شرح عملي ومفيد لبناء Tokenizer من الصفر youtu.be/zduSFxRajkE?si… يعتبرال Tokenizer عنصر اساسي في نماذج اللغة الكبيرة LLMs يقوم بتحويل النصوص الى وحدات نصية (tokens). ويمثل مرحلة مستقله تماما في مسار عمل النماذج و يمتلك مجموعات تدريب وخوارزميات تدريب خاصة مثل ترميز أزواج البايت
YouTube video
YouTube
العربية
1
0
2
156
rawabi
rawabi@ira__70·
حضور البروفيسور عمر بن مونس ياغي مفاجأة سارة وغير متوقعة للجميع أضاف قيمة استثنائية للحدث.👏🏻 #ICAN2026
العربية
0
0
1
137
rawabi
rawabi@ira__70·
Learning from the best at the International Conference on Data & AI Capacity Building (#ICAN) already excited for what’s in store tomorrow
English
0
0
0
108
rawabi retweetledi
Saad
Saad@Sa4d_k1·
في ظل التسارع الكبير في مجالات البيانات والذكاء الاصطناعي، أصبح من الصعب مواكبة أحدث التطورات والأبحاث العلمية، وفهم كيفية عمل هذه التقنيات والنماذج وبنائها، في وقت يقابِل ذلك نقصٌ واضح في المحتوى التعليمي المتخصص والعميق، خصوصًا باللغة العربية. نعلن عن تأسيس منصة ساعي التعليمية المتخصصة في الذكاء الاصطناعي وعلم البيانات، سعيًا لمواكبة هذه التطورات السريعة ونشر المعرفة، والمساهمة في تحقيق أهداف رؤية المملكة 2030 في بناء القدرات في البيانات والذكاء الاصطناعي وتنمية المهارات الوطنية المستقبلية ندعوكم للتسجيل في أول دورة لمنصة ساعي عن توليد البيانات، لتكونوا من أوائل الساعين في التعلّم والتطوّر في مجال الذكاء الاصطناعي، ولتصبحوا جزءًا من مجتمع ساعي التأسيسي التسجيل وتفاصيل الدورة الأولى متاحة عبر الرابط أدناه أو من خلال رمز QR forms.gle/1S62PcyzHyuFwJ… لتفاصيل اكثر والأسئلة تابعوا حسابنا: @saai_sa
Saad tweet media
العربية
14
50
362
71.1K
rawabi retweetledi
Trelis Research
Trelis Research@TrelisResearch·
How to Train Recursive Models? - A frontier in adaptive compute - TL;DR - I swapped out the transformer in @karpathy's Nanochat for a recursive transformer - It performs similarly when trained iso-FLOPs, but needs ~50% fewer parameters - Using recursion opens up a path to adaptive compute without the need for long reasoning traces SETUP: - Nanochat is a 20 layer model - I swapped out the middle 16 layers with a recursive 4-layer block. So, 2 prelude layers + 4 recursive layers (recursed 4x times on average) + 2 coda layers = 20 effective layers. - Training is iso-data & iso-flops RESULTS: - The core/aggregate score is a little lower than the 20 layer model - gsm8k is a little bit higher, and shows a meaningful effect of varying the number of recurrences at inference time WHY IS RECURSION INTERESTING? 1. You get a lower parameter model with similar performance => inference on smaller devices or fewer GPUs (allows smaller pipeline bubbles) 2. Opens up adaptive compute -> you vary inference compute based on difficulty IDEAS FROM LITERATURE ON ADAPTIVE COMPUTE - You can vary compute per token by recursing until the predicted probability distribution starts to look the same! No need for a trained halting head. - You can save on kv cache by just storing the state from the last recursion (throw out info from earlier recursions), it works! - For continuous batching with adaptive compute you probably need to separate the recursive block from prelude/code OR drop prelude/coda perhaps. OUTLOOK - Probably big labs are or should incorporate adaptive compute? - Expect libraries like @sgl_project and @vllm_project and perhaps @NVIDIAAI dynamo to start supporting it. - Big for edge device inference. Many thanks to @SeanMcleish for discussions in preparing this video/tweet. References: - Recursion & Adaptive Compute: arxiv.org/abs/2502.05171 - TRM Paper: arxiv.org/abs/2510.04871
Trelis Research tweet mediaTrelis Research tweet media
English
7
15
117
6.4K
rawabi
rawabi@ira__70·
Reasoning ≠ Scale Reasoning=Stability+Control+Feedback السبب في قوة Recursive reasoning يضيف تحكم في الاخطاء و استقرار أثناء التفكير. المشكلة في big dense models لا يعود لنقص capacity أو parameters بل error amplification فكل layer تضيف انحراف صغير ومع العمق يفشل في reasoning.
alphaXiv@askalphaxiv

Recursive reasoning beats multi-billion-parameter models You can now easily train your own 7M param model from scratch and outperform DeepSeek-r1 on ARC-AGI 1 We provide a simple speedrun script that handles setup, training, and eval in one go.

0
0
0
122
rawabi
rawabi@ira__70·
@AIVibecode كلامك صحيح أعتقد ان قراءته بشكل انتقائي مفيده حتى للممارسين خصوصا في فهم optimization وغيرها
العربية
0
0
1
142
Mohamed
Mohamed@AIVibecode·
هذا الكتاب ممتاز للناس اللي ناوية تكمل في مسار أكاديمي أو تكون باحثة في المجال بشكل أكبر لأنه كتاب دسم ، يربط الرياضيات بتعلم الٱلة و تطبيقاتها ، يبني لديك أساس قوي في الرياضيات و يعتبر صعب في رأيي لشخص غير أكاديمي أو شخص فقط يبحث أنه يكون ممارس عادي.
rawabi@ira__70

يعتبر هذا الكتاب Mathematics for Machine Learning من افضل المراجع اللي درستها في مرحلة الماجستير. الكتاب هو المفتاح لفهم الرياضيات المعقدة خلف خوارزميات تعلم الآله بكل دقة ووضوح. خطوة مهمة تعطيك الرؤية الكاملة لخلف الكواليس في عالم تعلم الآلة. mml-book.github.io

العربية
2
13
185
13.4K
rawabi
rawabi@ira__70·
يعتبر هذا الكتاب Mathematics for Machine Learning من افضل المراجع اللي درستها في مرحلة الماجستير. الكتاب هو المفتاح لفهم الرياضيات المعقدة خلف خوارزميات تعلم الآله بكل دقة ووضوح. خطوة مهمة تعطيك الرؤية الكاملة لخلف الكواليس في عالم تعلم الآلة. mml-book.github.io
rawabi tweet media
العربية
0
0
47
15.4K
rawabi retweetledi
DAIR.AI
DAIR.AI@dair_ai·
Top AI Papers of the Week (Dec 1 - 7): - DeepSeek-V3.2 - Is Vibe Coding Safe? - Quiet Feature Learning - Autonomous Cloud Reliability - Thinking with Programming Vision - Evolving Multi-Agent Orchestration - Training LLMs for Honesty via Confessions Read on for more:
English
4
24
165
23.9K
rawabi
rawabi@ira__70·
Program-Aided Language Models (PAL) هنا النموذج يصير قادر على كتابة كود حقيقي وتنفيذه للتحقق من الحل. بالتالي دقة أعلى بكثير في الحسابات الرياضية المعقدة لأن الكود بيتنفذ فعليا وليس مجرد تخمين يحتاج لبيئة تشغيل خارجية ليعمل بشكل كامل
العربية
0
0
0
79
rawabi
rawabi@ira__70·
Tree-of-Thought (ToT) أسلوب متقدم يستكشف عدة مسارات تفكير وليس مسار واحد.
مثل "شجرة قرارات" تسمح بالبحث المقارنة وحذف المسارات السيئة للوصول لأفضل حل.
فعّال في التخطيط الألعاب وحل المسائل المعقدة.
العربية
1
0
0
90
rawabi
rawabi@ira__70·
أهم 4 طرق لتحسين تفكير نماذج اللغة الكبيرة بدون اي تدريب إضافي الصورة توضح كيف يمكن تحسين أداء النموذج بدون اي تدريب إضافي فقط من خلال Prompting رابط الورقه arxiv.org/pdf/2502.03671
rawabi tweet media
العربية
1
0
0
103