Google Developers · AI·· 3 小时前AI 评分34
Qwen3 Embedding 8B 在 Cloud TPU 上实现企业级长上下文多模态嵌入推理
Enterprise-Grade Precision for Long-Context Multimodal Embedding Inference on Cloud TPU
AI 导读
Google Cloud 将 vLLM 原生 TPU 支持与 GKE 弹性扩缩容结合,在 Cloud TPU 上部署 Qwen3-Embedding-8B,支持 16K 上下文、bfloat16 精度。
来源:Google Developers · AI · developers.googleblog.com