Skip to main content

Tổng Quan Hệ Thống

OpenModex nằm giữa ứng dụng của bạn và các nhà cung cấp mô hình AI. Mọi yêu cầu đều đi qua một pipeline middleware thông minh trước khi đến nhà cung cấp tối ưu.

Luồng Yêu Cầu

1

Xác thực

Khóa API của bạn được xác thực và ánh xạ đến tài khoản, đội nhóm và giới hạn tốc độ của bạn.
2

Giới hạn tốc độ

Yêu cầu được kiểm tra theo giới hạn tốc độ của gói đăng ký (theo khóa, theo phút). Sử dụng Redis sorted sets để thực thi cửa sổ trượt chính xác.
3

Kiểm tra bộ nhớ đệm

Nếu bộ nhớ đệm prompt được bật, OpenModex kiểm tra phản hồi đã được lưu đệm khớp chính xác. Kết quả trúng bộ đệm được trả về ngay lập tức với chi phí nhà cung cấp bằng không.
4

Quyết định định tuyến

Công cụ định tuyến chọn nhà cung cấp tối ưu dựa trên chiến lược của bạn (chi phí, độ trễ hoặc chất lượng), tình trạng sức khỏe hiện tại của nhà cung cấp và cấu hình dự phòng.
5

Yêu cầu đến nhà cung cấp

Yêu cầu được chuyển đổi sang định dạng của nhà cung cấp đích và chuyển tiếp. OpenModex hỗ trợ chuyển tiếp streaming SSE theo thời gian thực.
6

Phản hồi + Siêu dữ liệu

Phản hồi của nhà cung cấp được chuẩn hóa về định dạng OpenAI, bổ sung siêu dữ liệu OpenModex (thông tin định tuyến, chi phí, độ trễ) và trả về cho ứng dụng của bạn.

Các Thành Phần Cốt Lõi

Cổng API

  • REST API tương thích OpenAI — thay thế trực tiếp API của OpenAI
  • Streaming SSE — phân phối token theo thời gian thực
  • Tính idempotent — thử lại an toàn với header Idempotency-Key (TTL 24 giờ)

Công Cụ Định Tuyến

Công cụ định tuyến duy trì cái nhìn thời gian thực về sức khỏe và hiệu suất của nhà cung cấp:

Bộ Ngắt Mạch

Sức khỏe của nhà cung cấp được giám sát tự động:
  1. Đóng — yêu cầu được định tuyến bình thường
  2. Nửa mở — sau các lỗi liên tiếp, lưu lượng bị giảm
  3. Mở — nhà cung cấp tạm thời bị loại khỏi nhóm định tuyến
  4. Phục hồi — các kiểm tra sức khỏe định kỳ khôi phục nhà cung cấp

Bộ Chuyển Đổi Nhà Cung Cấp

Mỗi nhà cung cấp AI được bọc trong một bộ chuyển đổi chuẩn hóa xử lý:
  • Chuyển đổi định dạng yêu cầu (định dạng OpenAI → định dạng gốc của nhà cung cấp)
  • Chuẩn hóa phản hồi (gốc nhà cung cấp → định dạng OpenAI)
  • Ánh xạ lỗi sang mã lỗi nhất quán
  • Chuyển đổi giao thức streaming
Nhà Cung Cấp Được Hỗ Trợ:

Lớp Bộ Nhớ Đệm

  • Bộ đệm khớp chính xác — hash của (mô hình + tin nhắn + tham số)
  • TTL có thể cấu hình — 60 giây đến 24 giờ cho mỗi yêu cầu
  • Dựa trên Redis — tra cứu bộ đệm dưới mili giây
  • Tiết kiệm chi phí — phản hồi từ bộ đệm được tính phí ~50% tỷ lệ đầu vào, không chi phí đầu ra

Pipeline Thanh Toán

  1. Mỗi yêu cầu phát ra một sự kiện thanh toán đến Kafka
  2. Các sự kiện được xử lý bất đồng bộ và lưu trữ
  3. Số dư tài khoản được cập nhật nguyên tử qua Redis Lua scripts
  4. Phân tích được đẩy sang Apache Doris cho bảng điều khiển và báo cáo

Cơ Sở Hạ Tầng

Bảo Mật

  • Khóa API được hash khi lưu trữ; chỉ tiền tố được lưu để tra cứu
  • Khóa nhà cung cấp BYOK được mã hóa bằng mã hóa phong bì AWS KMS
  • Giới hạn tốc độ sử dụng các phép toán Redis nguyên tử để ngăn điều kiện tranh chấp
  • Tất cả lưu lượng được mã hóa bằng TLS 1.3
  • Mật khẩu được hash bằng Argon2id

Sơ Đồ Luồng Dữ Liệu