2026年10月9日金曜日 掲載メディア5Newsについて🌓
🇯🇵 JP ▾
速報
› Russian Embassy vehicle in traffic incident near Japan’s Foreign Ministry› Russia demands Netherlands hand over ICC President Tomoko Akane› China announces candidate for WHO chief› アメリカで銃殺刑の生中継が計画されている› 米、12月に銃殺刑の「ライブ配信」計画か 13人射殺の死刑囚› Appleが10月13日に新製品発表会「Welcome Home」を開催、スマートホーム関連のガジェットが続々登場か› Japan has convenience store fried chicken-flavor instant ramen, but does it taste like it says it does?› コーヒーメーカーが10日間で1TBものデータを使用していたことが発覚› France to fight student unrest by dispatching thousands of teachers› 急増する不正アクセスにJPCERTが注意喚起 寄せられた情報から判明した「攻撃傾向」とは› Russian Embassy vehicle in traffic incident near Japan’s Foreign Ministry› Russia demands Netherlands hand over ICC President Tomoko Akane› China announces candidate for WHO chief› アメリカで銃殺刑の生中継が計画されている› 米、12月に銃殺刑の「ライブ配信」計画か 13人射殺の死刑囚› Appleが10月13日に新製品発表会「Welcome Home」を開催、スマートホーム関連のガジェットが続々登場か› Japan has convenience store fried chicken-flavor instant ramen, but does it taste like it says it does?› コーヒーメーカーが10日間で1TBものデータを使用していたことが発覚› France to fight student unrest by dispatching thousands of teachers› 急増する不正アクセスにJPCERTが注意喚起 寄せられた情報から判明した「攻撃傾向」とは
テクノロジー

Z.aiが中国製AIインフラで「GLM-5.3-Flash」の本番サービスを提供したノウハウを共有、AIエージェントでインフラを管理してNVIDIA GPUと同等まで効率化

GIGAZINE ·
Z.aiが中国製AIインフラで「GLM-5.3-Flash」の本番サービスを提供したノウハウを共有、AIエージェントでインフラを管理してNVIDIA GPUと同等まで効率化

親愛なる読者の皆さまへ。ご存じの通り価格高騰などの悪影響でサーバー運営がとても苦しい状態です。回線や台数を整理し見直せる部分は全て見直しましたが、やはりまだ危険水域です。このままだと1ページを10分割ぐらいして無理矢理PVを増やさざるを得なくなってしまいます。そこで、GIGAZINEの物理的なサーバーたちを、たった1円でも良いので親愛なる読者の皆さまに支援してもらえればとっても助かります!今すぐ寄付は上のボタンから! ・ これまでGIGAZINEを支援してくれたメンバーのリスト

中国のAI企業であるZ.aiが、「 GLM-5.3-Flash 」の本番サービスを提供するためにどのようにして独自の推論インフラストラクチャを構築したのかをブログで解説しています。 Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure https://z.ai/blog/glm-built-its-inference-infrastructure 本番環境のトラフィックを確実に処理できる高性能な推論サービスを提供するには、大規模なシステムエンジニアリング作業が必要です。GLM-5.3-Flashのリリースに際し、Z.aiは10万台以上の中国製AIアクセラレータからなるクラスタ上で、本番環境レベルの推論サービスをゼロから構築しています。記事作成時点でも、GLM-5.3-Flashのすべての本番環境における推論処理は、このシステム上で実行されているとのこと。 これについてZ.aiは「これは容易なことではありませんでした。これまで、これほどの規模で中国製AIアクセラレータのクラスタをデプロイした事例は皆無だったからです。チップのメモリ容量と帯域幅が比較的限られている一方で、新しいモデルアーキテクチャ、100万トークンのコンテキストウィンドウ、そしてマルチモーダルなリクエストをサポートする必要がありました。エコシステムは未成熟で、カーネルのサポートも不完全であり、本来文書化されるべき内容の多くは推測に頼らざるを得ませんでした。最終的に、この作業は完了しました。しかし、これはインフラエンジニアのチームだけで成し遂げられたものではありません。作業の大部分は、GLM-5.3を搭載したインフラエージェントによって実行されました」と説明しています。

We’re sharing how GLM-5.3 helped build and optimize the inference infrastructure serving GLM-5.3-Flash. The system went from its first successful run to production readiness in less than two weeks, with end-to-end throughput tripling relative to the initial baseline.

GIGAZINEで全文を読む ›

この要約はメディアの公開フィードから5Newsが集約したものです。 文脈も含めた全文はgigazine.netにあります — コンテンツの権利はGIGAZINEに帰属します。

他メディアでのこの話題

GIGAZINEのその他の記事

すべて見る ›

テクノロジーのその他の記事

すべて見る ›