پرش به مطلب اصلی

مدل‌های Z.ai و GLM

گدارAI شش مدل Z.ai را از API عمومی و مستقیم این ارائه‌دهنده پشتیبانی می‌کند. برنامه شما با توکن گدارAI درخواست می‌فرستد و کلید خام Z.ai فقط به‌صورت write-only در حساب ارائه‌دهنده نگه‌داری می‌شود.

این راهنما در ۲۰ شهریور ۱۴۰۵ با OpenAPI رسمی، راهنمای API، فهرست مدل‌ها و قیمت رسمی تطبیق داده شده است.

مدل‌ها و مسیرها​

مدلورودیخروجیمسیر گدارAIزمینه / بیشینه خروجی
glm-5.3متنمتنPOST /v1/chat/completions۱٬۰۰۰٬۰۰۰ / ۱۲۸٬۰۰۰ توکن
glm-5.2متنمتنPOST /v1/chat/completions۱٬۰۰۰٬۰۰۰ / ۱۲۸٬۰۰۰ توکن
glm-4.7-flashxمتنمتنPOST /v1/chat/completions۲۰۰٬۰۰۰ / ۱۲۸٬۰۰۰ توکن
glm-5v-turboمتن، تصویر، ویدئو و سندمتنPOST /v1/chat/completions۲۰۰٬۰۰۰ / ۱۲۸٬۰۰۰ توکن
glm-5.3-flashمتن، تصویر، ویدئو و سندمتنPOST /v1/chat/completions۱٬۰۰۰٬۰۰۰ / ۱۲۸٬۰۰۰ توکن
glm-ocrتصویر یا PDFMarkdown و داده چیدمانPOST /v1/layout_parsing یا POST /v1/ocrحداکثر ۳۰ صفحه در یک درخواست

مدل‌های glm-5.3 و glm-5.3-flash برخلاف بقیهٔ مدل‌های متنی/چندوجهی Z.ai، تفکر (thinking) همیشه فعال دارند و thinking.type: "disabled" را نمی‌پذیرند؛ گدارAI این درخواست را پیش از ارسال رد می‌کند. glm-5.3 علاوه بر این، فقط مقادیر low، high و max را برای reasoning_effort می‌پذیرد (نه مجموعهٔ کامل هفت‌مقداری glm-5.2)؛ مقدار پشتیبانی‌نشده پیش از ارسال با خطا رد می‌شود. مودالیتی‌های ورودی و رفتار فراخوانی تابع glm-5.3-flash تا انجام آزمون زندهٔ رسمی «تأییدنشده» علامت‌گذاری شده‌اند.

نام کامل مدل شامل ارائه‌دهنده و حساب است؛ برای مثال zai:production:glm-5.2. شناسه zai را با xai جایگزین نکنید؛ این دو ارائه‌دهنده مستقل‌اند.

ساخت حساب ارائه‌دهنده​

  1. در پنل مدیریت، «اتصال‌دهنده‌های LLM» را باز کنید و Z.ai را انتخاب کنید.
  2. API Key را وارد کنید. مقدار ذخیره‌شده دوباره نمایش داده نمی‌شود.
  3. نشانی پایه را روی https://api.z.ai/api/paas/v4 نگه دارید. گدارAI فقط میزبان HTTPS رسمی api.z.ai را می‌پذیرد.
  4. مدل‌ها و سیاست دسترسی مستأجر را انتخاب و حساب را ذخیره کنید.
  5. در صورت نیاز «تست اتصال» را جداگانه اجرا کنید. Z.ai مسیر بدون هزینه‌ای مانند GET /models ندارد؛ این آزمون یک درخواست یک‌توکنی و قابل‌صورتحساب به glm-4.7-flashx می‌فرستد و هنگام ذخیره حساب خودکار اجرا نمی‌شود.

استفاده در محیط آزمایش​

در Playground، حالت مناسب را از بالای صفحه انتخاب کنید:

  • «گفت‌وگو» برای مدل‌های متنی و glm-5v-turbo؛ تصویر را می‌توانید با URL، Base64 یا فایل محلی PNG/JPEG بدهید. ویدئو و سند فقط با URL در دسترس Z.ai ارسال می‌شوند.
  • «OCR» برای glm-ocr؛ URL یا فایل PDF/JPG/PNG، بازه حداکثر ۳۰ صفحه، تصویرهای برش‌خورده و نمایش دیداری چیدمان مستقیماً در فرم در دسترس‌اند.
  • در تنظیمات گفت‌وگو می‌توانید streaming، thinking، سطح effort مدل‌های glm-5.2 و glm-5.3، خروجی JSON Object برای مدل‌های متنی، ابزارها و tool streaming را تنظیم کنید. GLM-5V-Turbo در قرارداد فعلی endpoint پارامتر response_format ندارد.

Playground پاسخ Markdown، جزئیات خام چیدمان، usage و هزینه دلار/ریال ثبت‌شده توسط درگاه را نشان می‌دهد. انتخاب تصویر یا فایل OCR محلی، محتوا را در حافظه مرورگر برای همان درخواست به data URL تبدیل می‌کند؛ فایل به مخزن پرامپت ذخیره نمی‌شود.

گفتگو و استدلال​

curl "$GODARAI_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer $GODARAI_VIRTUAL_KEY" \
-H "Content-Type: application/json" \
-H "x-godarai-provider-account: production" \
-d '{
"model": "zai:production:glm-5.2",
"messages": [{"role":"user","content":"ریسک‌های این طرح را خلاصه کن."}],
"thinking": {"type":"enabled"},
"reasoning_effort": "high",
"max_tokens": 512
}'

در glm-5.2 مقادیر none، minimal، low، medium، high، xhigh و max برای reasoning_effort ثبت شده‌اند. glm-4.7-flashx و glm-5v-turbo این پارامتر را نمی‌پذیرند. برای غیرفعال‌کردن تفکر thinking: {"type":"disabled"} بفرستید.

glm-5.3 و glm-5.3-flash تفکر را همیشه فعال دارند و thinking.type: "disabled" را رد می‌کنند. برخلاف glm-5.3-flash (که مجموعهٔ کامل هفت‌مقداری reasoning_effort را می‌پذیرد)، مستندات و OpenAPI رسمی Z.ai برای glm-5.3 فقط low، high و max را ثبت کرده‌اند؛ مقدار پیش‌فرض و توصیه‌شده برای کدنویسی max است. گدارAI مقادیر خارج از این سه گزینه را برای glm-5.3 پیش از ارسال رد می‌کند.

برای پاسخ جریانی stream: true بفرستید و SSE را تا [DONE] بخوانید. اگر پاسخ شامل reasoning_content است، هنگام ادامه گفتگو آن را بدون تغییر در پیام assistant نگه دارید.

response_format در دو مدل متنی فقط {"type":"text"} یا {"type":"json_object"} است؛ JSON Schema پشتیبانی نمی‌شود. request_id باید ۶ تا ۶۴ نویسه و user_id باید ۶ تا ۱۲۸ نویسه باشد. گدارAI پیش از ارسال، user_id را با شناسه مستأجر و حساب به مقدار ناشناس و پایدار تبدیل می‌کند.

فراخوانی تابع​

glm-5.3، glm-5.2 و glm-4.7-flashx تا ۱۲۸ تابع سفارشی را می‌پذیرند. مقدار tool_choice فعلاً فقط auto است. نتیجه هر تابع را با نقش tool و همان tool_call_id برگردانید. فراخوانی تابع برای glm-5v-turbo تا رفع اختلاف مستندات رسمی و عبور آزمون زنده غیرفعال است؛ گدارAI درخواست نامطمئن را پیش از ارسال رد می‌کند.

برای دریافت جریانی فراخوانی ابزار، stream: true و tool_stream: true را همراه دست‌کم یک ابزار بفرستید. فراخوانی موازی ابزارها در قرارداد فعلی Z.ai فعال نیست.

تصویر، ویدئو و سند​

در glm-5v-turbo بخش‌های محتوای image_url، video_url و file_url پشتیبانی می‌شوند:

  • تصویر: URL یا Base64 با فرمت JPG/JPEG/PNG، حداکثر ۵ مگابایت و ۶۰۰۰×۶۰۰۰؛
  • ویدئو: URL فایل MP4/MKV/MOV، حداکثر ۲۰۰ مگابایت و دو ویدئو؛
  • سند: URL فایل PDF، TXT، Word، JSONL، XLSX یا PPTX، حداکثر ۵۰ فایل؛
  • file_url را در یک درخواست با تصویر یا ویدئو ترکیب نکنید.

OCR و تحلیل چیدمان​

curl "$GODARAI_BASE_URL/v1/layout_parsing" \
-H "Authorization: Bearer $GODARAI_VIRTUAL_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "zai:production:glm-ocr",
"file": "https://example.com/document.pdf",
"start_page_id": 1,
"end_page_id": 10,
"return_crop_images": false,
"need_layout_visualization": false
}'

پاسخ native Z.ai بدون تبدیل زیان‌بار برگردانده می‌شود. هزینه از usage.prompt_tokens و usage.completion_tokens بالادست محاسبه می‌شود؛ حسابداری صفحه‌ای Mistral برای Z.ai استفاده نمی‌شود. مسیر /v1/ocr یک alias برای همین قرارداد است، به شرط آنکه مدل glm-ocr باشد.

قیمت کاتالوگ​

مبالغ زیر دلار به‌ازای یک میلیون توکن‌اند:

مدلورودیورودی کش‌شدهخروجی
glm-5.3۱٫۴۰۰٫۲۶۴٫۴۰
glm-5.2۱٫۴۰۰٫۲۶۴٫۴۰
glm-4.7-flashx۰٫۰۷۰٫۰۱۰٫۴۰
glm-5v-turbo۱٫۲۰۰٫۲۴۴٫۰۰
glm-5.3-flash۰٫۱۵۰٫۰۳۰٫۵۰
glm-ocr۰٫۰۳—۰٫۰۳

در صورت نبود قیمت کامل یا usage معتبر، گدارAI پیش از ارسال یا هنگام نهایی‌سازی صورتحساب fail-closed می‌شود. نرخ‌ها مؤثر از تاریخ ثبت‌شده در کاتالوگ‌اند و تغییر بعدی با ردیف قیمت تازه اعمال می‌شود، نه بازنویسی مصرف گذشته.

محدودیت‌ها و رفع خطا​

  • stop تا زمان تأیید اختلاف مستندات رسمی، حداکثر یک رشته می‌پذیرد.
  • GLM-OCR در هر درخواست حداکثر ۳۰ صفحه می‌پذیرد؛ chunking پنهان انجام نمی‌شود.
  • کیفیت OCR فارسی تضمین رسمی ندارد؛ برای سند حساس مجموعه ارزیابی خودتان را اجرا کنید.
  • سهمیه و rate limit به حساب Z.ai وابسته است. گدارAI tier ساختگی تعریف نمی‌کند و خطای ۴۲۹ و Retry-After را منتقل می‌کند.
  • API مربوط به Coding Plan و سایر مدل‌ها/مسیرهای Z.ai در این اتصال فعال نیستند.
  • اگر خطای runtime_profile_unavailable می‌بینید، واردسازی کاتالوگ و revision استقرار را بررسی کنید.
  • اگر unsupported_parameter دریافت می‌کنید، پارامتر را با جدول همان مدل تطبیق دهید؛ پارامترهای ناشناخته به بالادست عبور داده نمی‌شوند.