文档 | 网站与演示 | 博客 | 中文博客 | CAMEL-AI
CRAB 是一个以 Python 为核心的 LLM 智能体基准测试环境构建框架。
🌐 跨平台与多环境
* 构建支持多种部署方式的智能体环境,包括内存内、Docker 容器化、虚拟机或分布式物理机,只要可通过 Python 函数访问即可。
* 通过统一接口让智能体同时访问所有环境。
⚙️ 易于使用的配置
* 只需在 Python 函数上添加 @action 装饰器即可添加新动作。
* 通过整合多个动作来定义环境。
📐 新颖的基准测试套件
* 以直观的原生 Python 方式定义任务及对应的评估器。
* 引入新型图评估器方法,提供细粒度指标。
pip install crab-framework[client]
所有数据集和实验代码位于 crab-benchmark-v0 目录中。使用我们的基准测试前,请仔细阅读基准测试教程。
export OPENAI_API_KEY=<你的 api 密钥>
python examples/single_env.py
python examples/multi_env.py
如果您在研究中使用到相关内容,请引用我们的论文:
@misc{xu2024crab,
title={CRAB: Cross-environment Agent Benchmark for Multimodal Language Model Agents},
author={Tianqi Xu and Linyao Chen and Dai-Jie Wu and Yanjun Chen and Zecheng Zhang and Xiang Yao and Zhiqiang Xie and Yongchao Chen and Shilong Liu and Bochen Qian and Philip Torr and Bernard Ghanem and Guohao Li},
year={2024},
eprint={2407.01511},
archivePrefix={arXiv},
primaryClass={cs.AI},
url={https://arxiv.org/abs/2407.01511},
}
加入我们(Discord 或 微信),共同探索智能体的扩展规律。