01 / OPERATIONS PLATFORM
荣耀天工运维平台
让设备、模型、Agent 和业务持续稳定运行02 / MODEL INFRA
荣耀天工 Infra
推理加速、模型量化、多芯片适配与统一模型服务3 款核心大模型、Prefill 与 Decode 六项指标全部超过友商。
Qwen3.5-122B-A10B
同模式 · AMD 395
Qwen3.6-35B-A3B
同模式 · AMD 395
Qwen3.6-27B-128K
同模式 · AMD 395
仅展示双方同模式结果。柱长在每个模型、每项指标内部归一化,单位为 tokens/s。
PERFORMANCE BENCHMARK
性能明细
只展示三款核心大模型的同模式结果,Prefill 与 Decode 六项指标全部领先。
| 模型 | 荣耀 Prefill | 友商 Prefill | Prefill 领先 | 荣耀 Decode | 友商 Decode | Decode 领先 |
|---|---|---|---|---|---|---|
| Qwen3.5-122B-A10B | 442.66 | 354.97 | +24.7% | 39.88 | 24.07 | +65.7% |
| Qwen3.6-35B-A3B | 1246.80 | 995.76 | +25.2% | 77.15 | 51.91 | +48.6% |
| Qwen3.6-27B-128K | 390.59 | 298.31 | +30.9% | 23.11 | 18.57 | +24.4% |
单位:tokens/s,数值越高越好。数据为双方同模式测试结果。
查看完整 Infra Benchmark →查看 AI 工作站配置
| 版本 | 芯片平台 | 内存 / 存储 | 参考模型规模 |
|---|---|---|---|
| 标准版 | Intel Core Ultra X7 358H | 64GB / 512GB | 35B |
| Pro版 | AMD Ryzen AI Max+ 395 / NVIDIA GB10 | 128GB / 1TB | 70B |
| Ultra版 | AMD Ryzen AI Max+ PRO 495 | 192GB / 2TB | 122B–200B |
| 信创定制版 | 后摩 M50 系列 | 按项目定制 | 35B–122B |
CORE TECHNOLOGY
推理加速与量化技术
从模型结构、量化精度和目标芯片出发,组合运行时、显存与并发优化,把模型转化为可部署、可调用、可持续运营的企业 AI 服务。
多精度量化
支持 IQ2_XXS、IQ3_XXS、IQ4_XS、Q2_K、Q3_K_S、Q4_K_S 以及 W5A8、W8A8 等量化路径,按模型、芯片与质量要求平衡体积、内存和效果。
权重量化 · 激活量化 · 精度评测Attention 与缓存优化
通过 Flash Attention、KV Cache Q8_0、长上下文缓存管理和内存复用,降低上下文增长带来的显存占用与数据搬运开销。
Flash Attention · KV Cache · 32K Context计算图与算子优化
结合目标后端进行图优化、算子融合、内存布局与热点算子适配,减少冗余计算和中间数据读写。
图优化 · 算子融合 · 内存复用推测解码
利用多 Token 预测与草稿验证缩短自回归生成链路,在适配模型上提升 Decode 吞吐,并保留可回退的标准解码路径。
多 Token 预测 · Draft Token · 结果校验批处理与并发调度
结合 Batch、连续批处理、请求排队和多模型路由,提高计算单元利用率,并根据时延与吞吐目标选择服务策略。
Batch4 · Continuous Batching · Routing异构推理后端
统一适配 Vulkan、ROCm、CUDA、OpenVINO、ONNX Runtime、llama.cpp 与厂商 SDK,使模型能够面向不同芯片平台部署。
AMD · NVIDIA · Intel · 国产芯片SUPPORTED MODEL TYPES
支持模型类型
当前模型跟踪与评测范围覆盖 7 类模型。每类模型根据硬件平台、量化版本、上下文长度和交付场景完成适配验证。
01大语言模型对话、推理、代码与 Agent 规划LLM · 4B–122B
覆盖 Dense 与 MoE 架构,可用于企业问答、长文总结、复杂推理、代码生成和智能体任务规划。
- Qwen3 / Qwen3.5 / Qwen3.6
- GLM-4.7 / GLM-4.7-Flash
- DeepSeek-R1
- Nemotron-3-Nano
- gpt-oss-20b
- Nanbeige4.1
- 量化
- IQ2 / IQ3 / IQ4、W5A8、W8A8
- 能力
- 对话 · 推理 · 代码 · 工具调用
02视觉语言模型图片理解、视频分析与多模态对话VLM · 4B–30B
联合视觉编码与语言推理,支持图片内容理解、图表分析、视觉问答和视频帧语义分析。
- Qwen3-VL 4B / 8B / 30B-A3B
- Qwen2.5-VL-7B
- GLM-4.6V-Flash
- Qwen3.5 多模态系列
- 输入
- 图片 · 图表 · 页面 · 视频帧
- 能力
- 识图 · VQA · 多模态推理
03语音识别模型音频转写、多语言与中文方言识别ASR
面向会议、采访、客服和现场录音,将本地音频转换为可检索、可总结、可进入业务流程的文本。
- Qwen3-ASR-0.6B
- Qwen3-ASR-1.7B
- Qwen3 ASR Encoder
- 音频解码 ONNX 模块
- 输入
- 本地音频 · 会议录音 · 语音流
- 能力
- 转写 · 多语言 · 方言识别
04OCR 与文档智能文字识别、版面分析与结构化解析OCR / DOC AI
覆盖端到端 OCR、检测识别、版面定位、表格与文档结构解析,为企业知识库和业务录入提供结构化数据。
- GLM-OCR-0.9B
- DeepSeek-OCR-2
- PaddleOCR-VL-1.6
- PP-OCRv5
- PP-StructureV3
- PP-DocLayout / PP-DocBlockLayout
- 输入
- 图片 · PDF · 扫描件 · 表格
- 能力
- 检测 · 识别 · 版面 · 结构化
05向量与重排序模型企业知识检索与 RAG 召回优化EMBEDDING / RERANKER
为企业知识库提供向量化、语义召回和结果重排序能力,提升专业问答的检索相关性与证据命中率。
- Qwen3-Embedding-4B
- Qwen3-Reranker-4B
- 链路
- 文档切分 · 向量召回 · 重排序
- 场景
- RAG · 知识库 · 语义搜索
06计算机视觉模型目标检测、分类与现场视觉分析CV
面向制造、安防、巡检和运营现场,提供低时延目标检测、图像分类与边缘视觉推理。
- YOLOv8x
- MobileNetV3-small
- 输入
- 图片 · 摄像头 · 视频流
- 能力
- 检测 · 分类 · 边缘推理
07图像与视频生成模型文生图、图片编辑与视频生成DiT / GENERATIVE MEDIA
支持本地图像生成与编辑,并持续跟踪视频生成模型;正式交付型号根据画质、时延和目标硬件完成版本验证。
- Z-Image-Turbo
- FLUX.2-klein-4B
- Qwen-Image-Edit-2511
- GLM-Image
- RealVideo / SCAIL-Preview
- HunyuanVideo-1.5
- 能力
- 文生图 · 图生图 · 图片编辑 · 视频生成
- 量化
- Q2_K · Q3_K_S · Q4_K_S
模型清单以当前适配与评测记录为准;具体交付版本需结合目标芯片、量化精度、上下文长度和业务验收要求确认。
03 / UNIVERSAL AGENT
荣耀天工 Agent
理解目标、规划任务、连接工具并进入企业业务流程TECHNICAL CONSULTATION