模型与路由
介绍主流对话模型与视频模型的命名规范、典型场景选型、上下文窗口管理及调用排查方法。
AnyStarX 聚合了多家上游服务商的模型资源。各模型的可用状态、计费标准、上下文长度上限与调用速率限制,均以管理控制台展示的信息为准。
模型 ID 获取规范
调用接口时,请求体中的 model 字段必须使用控制台模型列表中标注的完整标识符,避免因手工输入产生大小写或特殊符号错误。
根据上游路由实现的不同,模型标识符通常采用以下两种格式之一:
一种带有提供商前缀:
openai/gpt-4o
anthropic/claude-sonnet-4-5
google/gemini-2.5-flash
deepseek/deepseek-chat另一种直接使用上游的原始模型名称:
gpt-4o
claude-sonnet-4-5
gemini-2.5-flash
deepseek-chat在配置客户端或编写请求代码时,直接以控制台模型列表中的字符串为准进行复制。
典型场景选型
| 业务场景 | 建议的模型方向 | 说明 |
|---|---|---|
| 文本翻译、内容摘要与通用问答 | 轻量级高响应速度模型 | 延迟较低且单次调用成本更为经济 |
| 代码生成、代码重构与项目排查 | 具备强推理能力与工具调用的模型 | 优先选用 Claude 或 OpenAI 系列中擅长编程分析的模型 |
| 批量文档处理、海量数据转换 | 兼顾高吞吐与稳定性的模型 | 优先保障任务执行稳定性与整体成本控制 |
| 结合参考图片生成动态视频 | 专用的视频生成模型(如 h3) | 遵循异步任务提交与轮询状态的调用流程 |
视频生成模型
视频生成接口基于 Sora 兼容规范设计,在示例中使用的模型标识符为 h3。接口采用异步流程,通过 POST /v1/videos 提交生成任务,支持配置 task: "ref2va"、seconds: "4"、resolution: "480p" 以及包含参考图片地址的 conditions 数组。
从上传素材图片、提交生成任务到轮询任务状态和下载成品的具体步骤,可以参考 视频生成。任务提交后需要持续查询任务状态,直至 status 字段返回 completed 之后再拉取视频内容。具体的参数支持情况与生成约束以控制台说明为准。
性能、质量与成本权衡
在选择模型时,通常需要在输出质量、响应速度和调用成本之间进行综合评估:
- 高推理能力的旗舰模型在复杂逻辑与长代码生成上表现更好,但单次 token 调用的计费单价通常高于轻量模型。
- 长上下文请求不仅会占用更多的处理时间,也会按实际输入的 token 总量计费。
- 批量处理和自动化脚本更看重吞吐稳定性和重试成功率,通常无需盲目追求参数规模最大的模型。
建议在接入新流程时,先使用响应速度快、成本较低的模型验证网络连通性与数据解析逻辑;在确认工作流程运转正常后,再根据任务难度切换为对应能力等级的模型。
上下文窗口限制与处理
上下文长度是指模型在一次处理过程中能够接收并处理的信息上限,涵盖系统提示词、多轮历史对话、工具返回的调试信息以及本轮输出的文本。
在 coding agent 这类自动化工具中,如果一次性将大型项目的全部文件或海量运行日志写入上下文,容易出现以下情况:
- 接口响应时间显著拉长。
- 单次交互消耗的输入 token 数量急剧增加。
- 达到或超出模型的最大上下文长度限制,导致接口返回错误。
- 输入内容过多导致模型对早期指令和约束条件的遵循能力下降。
针对长上下文场景,建议采取以下优化措施:
- 限制 agent 仅读取与当前修改直接相关的文件与代码块。
- 将复杂的大型任务拆解为若干执行步骤清晰的子任务。
- 对超长文本进行前置摘要,避免无节制地向请求中附加完整日志。
模型调用失败排查
如果调用时接口返回 model_not_found、model not available 或类似提示,可以按照以下步骤逐步排查:
- 登录控制台核对模型列表,确认该模型当前对您的账号开放,并重新复制完整模型 ID。
- 确认请求地址中的 Base URL 正确指向
https://console.anystarx.com/v1,未混用官方原始地址。 - 使用基础的 curl 命令行发起最小可用请求,排除客户端界面参数干扰。
- 尝试切换同一提供商旗下的其他模型进行调用测试,以确认是特定模型维护还是全局网络配置问题。