چتجیپیتی، کلود، جمنای و گراک همگی در برابر GTO Wizard بازندگان بزرگی بودند؛ برخی از آنها حتی بدتر از کسی که هر دست را فولد میکند، بازی کردند.
شاید زمانی فرا رسد که مدلهای زبانی بزرگ (LLMها) بتوانند بازی پوکر را در هم بشکنند، اما به گفته GTO Wizard، آن زمان هنوز نرسیده است.
آنها فاش کردهاند که تمام LLMهای اصلی از جمله GPT 5.4، Claude Opus 4.6، Gemini 3.1 و Grok 4 را محک زدهاند. این مدلها ۵۰۰۰ دست پوکر هدزآپ بدون محدودیت بازی کردند و در هر مورد، هوش مصنوعی با در نظر گرفتن شانس، یک بازیکن بازنده بود.
بهترین LLM از نظر عملکرد، GPT 5.3 بود، اما حتی آن هم با در نظر گرفتن شانس، ۱۶ BB/100 از دست داد. GPT 4 با نرخ ۱۳۶ BB/100 باخت. گراک ۶۰ BB/100 از دست داد که در واقع نزدیک به ضرر استراتژی صرفاً فولد کردن است (-۶۴.۶ BB/100).
حجم نمونه کوچک است، زیرا هزینه اجرای این شبیهسازیها بسیار بالا است.
کارشناسان GTO Wizard استدلال کردهاند که LLMها از عدم قطعیت بیزارند و نمیتوانند با اطلاعات پنهان، متعادلسازی رنجها، برنامهریزی بلندمدت یا شناسایی حریفان در شرایط عدم قطعیت عمیق کنار بیایند. جالب توجه است که در ۲٪ مواقع، LLMها کارتهای خود را اشتباه میخواندند.
سال گذشته، LLMهای اصلی با یکدیگر به رقابت پرداختند که چتجیپیتی در مجموع برنده شد، اما آن رقابت بین خود LLMها بود و توسط GTO Wizard رتبهبندی نشده بود. GTO Wizard اکنون بنچمارک خود را برای سایر LLMها باز کرده است تا شانس خود را برای سودآوری در برابر یک بازیکن پوکر بینقص امتحان کنند.
در حالی که در پوکر و به طور کلی در مورد هوش مصنوعی، پیشبینیهای بدبینانه زیادی وجود دارد، نشانههای فراوانی حاکی از آن است که نبوغ انسانی هنوز جایگاه خود را در جهان دارد. به نظر میرسد هنوز تا زمانی که چتجیپیتی بازی مورد علاقه ما را از بین ببرد، فاصله زیادی داریم.
کلمات کلیدی: هوش مصنوعی، مدلهای زبانی بزرگ، LLM، پوکر، چتجیپیتی، GTO Wizard، شکست هوش مصنوعی، بازی پوکر، استراتژی پوکر، GPT، کلود، جمنای، گراک، عدم قطعیت، نبوغ انسانی.
هشتگها: #هوش_مصنوعی #پوکر #LLM #ChatGPT #GTO_Wizard #شکست_هوش_مصنوعی #بازی_پوکر #مدل_زبانی_بزرگ












Leave a Reply