RUISHU AI CLOUD

算力驱动,智领未来

面向开发者与企业团队,提供大模型云服务、推理加速、模型应用构建和 AI 算力运营能力,帮助业务快速接入稳定、高效、可扩展的生成式 AI 基础设施。

全链路 Token 流转 服务在线
🧠
主流大模型Claude · GPT · Gemini · DeepSeek · 国产开源
输入
🚪
模型网关统一 API · 智能路由 · 故障转移
入口层
⚙️
Token 引擎算力调度 · 推理优化 · 预扣实扣
效率层
🏭
算力中枢私有化 · SaaS · Agent 行业方案
价值层
99.9%平台可用性
30+主流模型
一个入口打通模型网关、Token 引擎和算力中枢
30+
主流大模型
覆盖对话/多模态/推理
4
异构 GPU 算力
4090 / H20 / A800 / 910B
99.9%
平台可用性
PRD 4.x 容灾承诺
¥186亿
中国 MaaS 市场
IDC · 2026

不只是接入,而是全链路价值运营

直击中转站三坑,超越单纯 API 转发,在效率优化与行业方案上建立壁垒。

不掉包·不跑路

官方授权采购,模型与版本可溯源;企业实名与风控告警,告别中转站「掉包降级 / 站长跑路」。

vs OneAPI 中转站

价格透明可溯

输入/输出价统一公开,预扣-实扣计费精确到 4 位小数,账单流水与发票可查,无虚高加价。

vs 价格虚高中转站

效率层降本

不只做接入,更做推理优化与算力调度。自研优化持续压低单 Token 成本,让调用更便宜。

vs 仅接入的 OpenRouter

行业价值落地

不止卖 API,更提供私有化 / SaaS / Agent 行业方案,把 Token 转化为可量化的业务价值。

vs 停在接入层的竞品

覆盖模型调用、算力租赁到企业交付

四大模块分别服务开发者、算法工程师、运维与企业采购方,全流程支撑 AI 应用落地。

聚合平台

模型、价格与调用方式,集中在同一处

先公开展示模型能力与价格,登录后管理 API Key、用量、日志与账单。预扣-实扣计费,余额递进式预警(2/1/0.5/0 元)与超量熔断。

算力租赁

先选任务,再选一台真正适合的 GPU

按任务类型推荐:开发推理选 4090,高性能推理选 H20,训练部署选 A800 / Ascend 910B。云实例、裸金属包月、AI 工作站全形态,实时库存与透明报价。

开发者中心

三分钟完成第一次 API 调用

兼容 OpenAI 调用格式,替换 API Key 与 Base URL 即可迁移。提供 Python / Java / Node SDK、完整 API 文档与 request_id 全链路调试。

企业服务

从采购一批 Token,到部署一套企业 AI 能力

面向采购、数据安全、专属算力或资源合作需求,提供私有化部署、专属模型与算力、商务合作等可落地方案。专属客户经理 1 对 1 对接。

从登录到账户接入
四步开始 API 调用

先登录或注册,再进入控制台完成额度、密钥和首次调用配置。

1
登录或注册账户

点击「登录控制台」或「免费开始」,完成身份验证后进入个人账户。

2
确认账户与充值额度

在控制台概览和钱包中确认账户状态,按需充值可用额度。

3
创建 API Key

控制台 → API 密钥 → 创建密钥,明文仅显示一次,支持模型权限管理。

4
完成首次调用

复制兼容 OpenAI 的请求示例,替换 API Key 和 Base URL 后开始调用。

cURLPythonNode
# 兼容 OpenAI 格式,仅改 base_url 与 api_key
curl https://mjlm.coral-gpu.com:3000/v1/chat/completions \
  -H "Authorization: Bearer $CORAL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-chat",
    "messages": [{"role": "user", "content": "你好"}],
    "max_tokens": 512
  }'

# 200 OK → 首次调用成功,用量自动计费

先看到价格,再决定调用

输入/输出价格统一透明,计费公式 消耗 = 输入Token×输入单价 + 输出Token×输出单价,精确到小数点后 4 位,无隐藏费用。

DeepSeek-V4-Flash
高性价比快速对话模型
¥1.00 / 1M tokens
未命中输入价;输出 ¥2.00/M
  • 1M 超长上下文
  • 适合客服、内容生成
  • 缓存命中输入 ¥0.02/M
Kimi-K2.7-Code
代码与智能体任务模型
¥6.50 / 1M tokens
未命中输入价;输出 ¥27.00/M
  • 256K 长上下文
  • 代码生成与 Agent 工作流
  • 缓存命中输入 ¥1.30/M
查看完整价格表

从采购一批 Token,
到部署一套企业 AI 能力

面向有采购、数据安全、专属算力或资源合作需求的企业客户,提供可落地的服务方案。专属客户经理 + 解决方案架构师全程跟进,方案最快 3 个工作日交付。

🔒
数据安全与私有化支持 BYOC、专属 VPC、私有化模型部署
🤝
专属商务与技术支持客户经理 + 解决方案架构师全程跟进
📈
灵活计费与资源合作按需、包月、资源互换多种模式

发现并使用最适合业务的 AI 模型

兼容 OpenAI / Claude / Gemini 协议,覆盖文本、图像、语音、视频。统一鉴权、统一计费、智能路由,一个 API 调用百款主流模型。

89+主流模型
6+厂商接入
~300ms平均延迟
99.9%可用性承诺

本周热门 ↑

  • DeepSeek-V4-Pro+24%
  • Claude Opus 5+18%
  • GPT-5.6+12%
  • Qwen3.7 Flash+9%
  • doubao-seedance-2.0视频
89 个模型,已筛选 12
D

DeepSeek-V4-Pro

Chat
by deepseek-ai
最新 MoE 大语言模型,1.6T 总参 / 498B 激活,原生支持 100 万 tokens 超长上下文。Agent 能力与世界知识与推理性能领先国内开源领域。
输入价
$0.435/M
输出价
$0.87/M
视觉函数推理缓存搜索代码
+24%
A

Claude Opus 5

ProChat
by anthropic
Anthropic 旗舰推理与编码模型,擅长复杂软件任务、代码审查、图表分析、并行子代理协调,强指令遵循与工具使用。
输入价
$1.00/M
输出价
$5.00/M
视觉函数推理缓存代码长文
+18%
G

Gemini 3.5 Flash Lite

Chat
by google
Google 高效率模型,强化 Agent 能力。适合多智能体工作流中执行聚焦任务的子代理,速度快、成本低。
输入价
$1.20/M
输出价
$7.20/M
视觉函数缓存搜索音频
+11%
Q

Qwen-Image 3.0 Pro

付费
by qwen
阿里最新图像生成模型,原生支持中英文渲染与多种风格,可控性提升明显,免费不限量体验。
分辨率
2K
并发
价格
¥3.6
延迟
~3s
图像文本渲染风格免费
+32%
C

Claude 3.5 Sonnet

Chat
by anthropic
编码能力 SWE-Bench 49%,数据科学、视觉处理与 Agent 任务表现卓越,长上下文稳定。
输入价
¥24
输出价
¥96
视觉函数代码数据
−3%
G

GPT-5.6

ProChat
by openai
OpenAI 旗舰多模态模型,视觉+文本理解、复杂推理与代码生成领先,企业级稳定路由。
输入价
$1.00/M
输出价
$6.00/M
视觉函数推理JSON代码
+12%
首页 / 模型广场 / DeepSeek-V4-Pro
D

DeepSeek-V4-Pro Chat

by deepseek-ai · 2026-04-23 发布

DeepSeek V4-Pro 是 DeepSeek 推出的最新 MoE 大语言模型,拥有 1.6T 总参数与 498B 激活参数,原生支持 100 万 tokens 超长上下文。在 Agent 能力、世界知识与推理性能上均实现国内与开源领域的领先,适合复杂任务处理、长文档分析与多轮对话。

模型简介

DeepSeek V4-Pro 是面向生产环境的旗舰推理模型,采用 1.6T 总参数 / 498B 激活的混合专家架构,支持 100 万 tokens 原生超长上下文。在 SWE-Bench、HumanEval、MMLU 等多项基准上接近或超过同规模闭源模型。

关键能力矩阵

视觉理解(图像 + 图表)
函数调用 / Tools
提示缓存
联网搜索
代码生成与执行
JSON 模式
流式输出(Streaming)
音频输入
音频输出
视频生成
长文档分析
Agent / 多步推理

典型场景

适合企业级复杂任务:长文档摘要与对比、代码审查与重构、数据分析与可视化、多轮对话客服、智能 Agent 编排、复杂结构化输出与 JSON 生成。

支持的协议

OpenAI /v1/chat/completions Anthropic /v1/messages

调用时仅替换 base_urlapi_key,业务代码零修改。

注意事项

• 输入中包含敏感数据时请配置数据策略
• 缓存命中价仅适用于提示缓存场景
• 长上下文建议配合流式输出以降低首字延迟

价格明细(单位:美元 / 百万 tokens)

计费项价格说明
输入$0.435/M所有输入 token,含系统提示、用户消息、工具结果
输出$0.87/M模型生成的输出 token
缓存命中$0.07/M提示缓存命中部分,按 0.167 倍输入价
缓存写入$0.65/M首次写入缓存,按 1.5 倍输入价
音频输入¥0.04/分钟音频转录与理解
网页搜索¥0.014/次按搜索次数计费
计费示例:一次 5K 输入 + 2K 输出的对话 ≈ 0.005×0.435 + 0.002×0.87 = $0.0039。如使用提示缓存(4K 命中),实际费用 ≈ 0.001×0.435 + 0.004×0.07 + 0.002×0.87 = $0.0025
消耗金额 = 输入Token × 输入单价 + 输出Token × 输出单价(美元/百万 Tokens,精确到小数点后 4 位)
~300ms
首字延迟 P50
~680ms
首字延迟 P99
120tok/s
平均输出吞吐

基准测评对比

SWE-Bench
68.4
MMLU
88.7
HumanEval
82.1
GSM8K
94.2
MT-Bench
86.5
Python cURL Node.js
# 兼容 OpenAI SDK,仅替换 base_url 与 api_key
from openai import OpenAI

client = OpenAI(
    base_url="https://mjlm.coral-gpu.com:3000/v1",
    api_key="YOUR_CORAL_API_KEY",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {"role": "system", "content": "你是一位资深架构师。"},
        {"role": "user",   "content": "如何为 AI 聚合平台设计 Token 限流?"},
    ],
    temperature=0.6,
    max_tokens=1024,
)

print(response.choices[0].message.content)
curl https://mjlm.coral-gpu.com:3000/v1/chat/completions \
  -H "Authorization: Bearer $CORAL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [{"role":"user","content":"Hello"}],
    "temperature": 0.6,
    "max_tokens": 1024
  }'
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://mjlm.coral-gpu.com:3000/v1",
  apiKey: process.env.CORAL_API_KEY,
});

const resp = await client.chat.completions.create({
  model: "deepseek-v4-pro",
  messages: [{ role: "user", content: "Hello" }],
});

console.log(resp.choices[0].message.content);

更新日志

  • 2026-04-23 · 正式发布 DeepSeek V4-Pro(1M 上下文、函数调用、视觉理解)
  • 2026-04-15 · 接入睿枢AI 平台,输入 $0.435/M / 输出 $0.87/M
  • 2026-04-10 · 预发布内测,面向企业用户开放灰度
DDeepSeek V4-Pro
温度 0.6
Max Tokens 2048
系统提示
DeepSeek V4-Pro 上下文 128K · Enter 发送

有什么可以帮你的?

在下方输入消息开始与模型对话

GPU COMPUTE RENTAL

先选任务,再选一台真正适合的 GPU

按小时、按天或包月使用 GPU 云实例、裸金属和 AI 工作站。规格、库存、价格与交付方式一目了然,按使用方式分类,而不是按内部运营流程分。

4GPU 算力
3交付方式
6区域全球节点
99.9%SLA 保障
推荐资源 库存实时同步
开发与推理
RTX 4090 · 24G
¥1.06/小时起
高性能推理
H20 · 96G
支持多卡部署
训练与部署
A800 · 80G
裸机/包月
国产化首选
Ascend 910B
企业专属性
14 款 GPU 实例,已筛选 6

RTX 4090

热门现货
NVIDIA · Ada Lovelace
VRAM
24 GB
RAM
125 GB
vCPUs
16
FP16 算力
165 TFLOPS
开发推理小模型训练支持多卡
华东 · 上海 库存 24 台
可用
¥1.06/小时起包月 ¥580

H20

Pro现货
NVIDIA · Hopper · 国产首选
VRAM
96 GB
RAM
188 GB
vCPUs
24
FP16 算力
296 TFLOPS
高性能推理多卡部署NVLink兼容国内
华东 · 上海 库存 12 台
可用
¥8.50/小时起包月 ¥4,500

A800 80G

现货
NVIDIA · Ampere · 训练部署
VRAM
80 GB
RAM
256 GB
vCPUs
32
FP16 算力
312 TFLOPS
训练部署裸金属NVLink大模型
华北 · 北京 库存 8 台
可用
¥12.00/小时起包月 ¥6,500

Ascend 910B

国产
华为昇腾 · 信创首选 · 企业专属
HBM
64 GB
RAM
192 GB
vCPUs
24
FP16 算力
376 TFLOPS
国产化信创合规CANN私有化
华北 · 北京 库存 需预约
预约
¥9.80/小时起包月 ¥5,200

L40S

NVIDIA · Ada · 推理与图形
VRAM
48 GB
RAM
94 GB
vCPUs
16
FP16 算力
362 TFLOPS
推理图形渲染视频处理
华东 · 上海 库存 18 台
可用
¥4.20/小时起包月 ¥2,200

RTX 5090

现货
NVIDIA · Blackwell · 下一代
VRAM
32 GB
RAM
35 GB
vCPUs
9
FP16 算力
209 TFLOPS
下一代开发推理节能
海外 · 新加坡 库存 6 台
紧张
¥1.58/小时起包月 ¥860
首页 / 算力租赁 / RTX 4090 · 配置实例
R

RTX 4090 现货

NVIDIA Ada Lovelace · 适合开发推理与小模型训练
  • 24 GB GDDR6X
  • 125 GB RAM
  • 16 vCPUs
  • FP16 165 TFLOPS
  • 支持多卡
起售价
¥1.06
/小时起 · 包月 ¥580
选择 GPU
2配置实例
3确认下单
4支付

1 选择区域与交付方式

选择最近区域可获得更低延迟;不同交付方式对应不同计费模式
交付方式
区域
GPU 数量
支持 1-8 卡集群(多卡需同型号同区域)

2 选择镜像

预装深度学习框架与驱动的镜像,开机即用

3 存储与网络

系统盘随实例销毁;数据盘可保留。公网 IP 按需分配
存储配置
系统盘(高性能 SSD)随实例释放
¥0.20/月
数据盘(持久化)独立生命周期
¥0.10/月
网络存储(高性能)共享存储
¥0.14/月
网络
公网带宽按使用流量计费
¥0.8/GB
安全组默认 / 自定义
免费

4 实例信息

为实例命名以便管理;选择项目归集
实例名
所属项目
选择 GPU
配置实例
3确认下单
4支付

1 订单确认

实例名
coral-train-4090-001
GPU 型号
NVIDIA RTX 4090 × 1
交付方式
按小时 (弹性扩缩)
区域
华东 · 上海 (延迟 ~12ms)
系统镜像
PyTorch 2.3 + CUDA 12.4
存储配置
系统盘 100GB + 数据盘 500GB + 网络存储 100GB
网络带宽
100 Mbps 独享 (按流量 ¥0.8/GB)
所属项目
研发项目
自动续费
✓ 已启用
预计交付
~3 分钟 (库存实时调度)

2 选择支付方式

当前账户余额充值历史 / 消费明细见控制台
¥128.60
使用余额抵扣

3 发票信息(可选)

费用明细

GPU 实例 (按小时)¥1.06/小时
存储 (700GB × ¥0.10)¥70.00/月
网络带宽按流量 ¥0.8/GB
首单优惠 (20%)−¥15.27
余额抵扣−¥54.79
实付金额¥0.00
点击「确认支付」即视为同意 《睿枢AI 服务协议》《SLA 承诺》

服务保障

  • 99.9% 平台可用性 SLA
  • 7×24 小时技术支持
  • 不满意 24 小时全额退款
  • 数据三重备份 · 异地容灾
  • 支持企业私有化部署
首页 / 算力租赁 / AI 工作站
AI WORKSTATION

开箱即用的AI 开发工作站

无需配置环境,开机即用。预装主流 AI 框架、开发工具与 JupyterLab、WebIDE,登录即可开始训练、推理、微调与数据处理。

coral-workstation@4090 ~ GPU 在线 · 24°C
# 启动 JupyterLab + SSH + WebIDE $ coral ws start --gpu=4090 分配节点: cn-sh-3.141 Jupyter: https://ws.coral-gpu.com/u/user_001 SSH: ssh user_001@ws.coral-gpu.com -p 22022 WebIDE: https://ide.coral-gpu.com GPU 0: RTX 4090 · 24GB · 0°C# 一键运行 Llama 3 微调 $ coral run examples/llama3-finetune.py Loading model... 8B params · 24GB ✓ Training step 100/500 · loss 1.24
预装模板

一键启动,专注你的 AI 任务

选一个最贴近你工作的模板,几秒钟就能进入开发

🔥

大模型微调

Llama 3 / Qwen 2 / DeepSeek 等主流开源模型的 LoRA / 全量微调模板

  • PyTorch + DeepSpeed
  • 预置数据集
  • 支持 DPO / SFT / RLHF

vLLM 推理服务

基于 vLLM 的高性能推理,开机即得 OpenAI 兼容 API

  • vLLM 0.5
  • Continuous batching
  • 动态扩缩
🎨

ComfyUI 图像生成

Stable Diffusion / FLUX 工作流,含常用节点与 ControlNet

  • ComfyUI Manager
  • 10+ 工作流模板
  • 支持 LoRA 热加载
📊

数据分析实验室

Pandas + Jupyter + Polars,开箱即用的数据科学工作台

  • JupyterLab
  • 常用数据集
  • 可视化模板
🤖

Agent / RAG 开发

LangChain / LlamaIndex / AutoGen 等 Agent 框架开发环境

  • 主流 Agent 框架
  • 向量数据库
  • 示例项目
🐳

纯净开发环境

Ubuntu + Docker + VSCode Server,只装你需要的

  • Ubuntu 22.04
  • Docker / Compose
  • VSCode Server
首页/算力租赁/GPU裸金属
GPU BARE METAL

物理机独占的GPU 裸金属算力

整台物理 GPU 服务器独占交付,无虚拟化损耗,获得 100% 算力与显存。适合大模型训练、高性能推理与对数据隔离有严格要求的场景。

100%算力独占·无损耗
8单机最大集群
NVLink全互联
99.99%裸机 SLA
裸金属机型库存实时同步
训练旗舰
8×A800 80G
¥78,000/月
高性能推理
8×H20 96G
¥98,000/月
性价比
8×4090 24G
¥18,000/月
国产化
8×昇腾 910B
¥62,000/月
6 款裸金属机型
按算力排序

需要更大规模或定制配置?

支持 16/32/64 卡集群、跨节点 InfiniBand 互联、定制镜像与私有化部署

提交大宗算力需求
下午好,开发者
核心路径: 创建 Key → 首次调用 → 查看用量
查看文档+ 创建 API Key
当前余额
¥128.60
↓ 5.2%
本月消费
¥46.82
↑ 12.3%
累计 Tokens
12.8M
↑ 8.7%
请求数
8,426
↑ 15.6%
成功率
99.7%正常
↑ 0.1%
用量趋势
请求数消费额
热门模型 Top 5
  • 1GPT-4o2,840 次
  • 2Claude 3.5 Sonnet1,920 次
  • 3DeepSeek-V31,560 次
  • 4Gemini 1.5 Pro980 次
  • 5Qwen2.5-72B620 次
最近请求
时间模型状态延迟费用
14:32:18Claude Sonnet成功1.8s¥0.024
14:31:42DeepSeek Chat成功820ms¥0.006
14:28:05GPT-4o mini成功450ms¥0.003
14:25:33Gemini 1.5 Pro成功2.1s¥0.035
14:20:11Qwen2.5-72B成功1.2s¥0.012
查看全部 →
API Keys
管理你的 API 访问凭证,用于调用大模型服务
+ 创建新 Key
活跃 Keys
5
↑ 1 本周新增
本月调用次数
8,426
↑ 12.4% 较上限
异常请求率
0.3%
↓ 0.2% 较上周
名称API Key权限创建时间最后使用状态操作
生产环境 Keysk-prod-××××7h2 📋全部权限2026-07-155 分钟前活跃查看 · 重置 · 删除
测试环境 Keysk-test-××××8p3 📋只读权限2026-07-082 小时前活跃查看 · 重置 · 删除
CI/CD 部署 Keysk-cicd-××××z9k5 📋推理调用2026-06-221 天前活跃查看 · 重置 · 删除
移动端 App Keysk-mob-××××w4m7 📋推理调用2026-06-153 天前闲置查看 · 重置 · 删除
数据分析 Keysk-ana-××××k3p9 📋全部权限2026-05-301 周前活跃查看 · 重置 · 删除
共 5 条记录