Supported Providers
OpenAI
GPT-4o, GPT-4o-mini, GPT-5, and more
Azure OpenAI
Enterprise OpenAI models on Azure
Anthropic
Claude 3.5 Sonnet, Claude 3 Opus, and more
Google Gemini
Gemini Pro and Gemini Flash
Groq
Fast inference with Llama, Mixtral, and more
Default Provider (OpenAI)
By default, Graphiti uses OpenAI’s GPT-4o-mini:OpenAI Configuration
Basic Setup
Configuration Options
Environment Variables
Recommended Models
gpt-4o- Best quality for complex extractiongpt-4o-mini- Balanced performance and costgpt-5-mini- Fast extraction with good qualityo1-mini- Reasoning model for complex relationships
Azure OpenAI
Use OpenAI models deployed on Azure:Environment Variables
Anthropic (Claude)
Use Claude models for extraction:Environment Variables
Recommended Models
claude-3-5-sonnet-20241022- Best quality and reasoningclaude-3-5-haiku-20241022- Fast and cost-effectiveclaude-3-opus-20240229- Maximum capability
Google Gemini
Use Google’s Gemini models:Environment Variables
Recommended Models
gemini-1.5-pro- Best qualitygemini-1.5-flash- Fast inferencegemini-2.0-flash- Latest fast model
Groq
Use Groq for ultra-fast inference:Environment Variables
Recommended Models
llama-3.3-70b-versatile- Best Llama modelllama-3.1-8b-instant- Fast inferencemixtral-8x7b-32768- Good for long contexts
Custom Base URLs
Use custom endpoints for OpenAI-compatible APIs:- OpenRouter
- Together AI
- Local LLM servers (Ollama, vLLM, etc.)
- Any OpenAI-compatible API
Token Tracking
Graphiti tracks token usage across all LLM calls:Model Selection Strategy
Graphiti uses two model types:- Primary Model
- Small Model
Used for:
- Entity extraction
- Relationship extraction
- Complex reasoning
- OpenAI:
gpt-4o - Anthropic:
claude-3-5-sonnet-20241022 - Gemini:
gemini-1.5-pro
Cost Optimization
Use Small Models
Set
small_model to a cost-effective option like gpt-4o-mini or claude-3-5-haiku-20241022Batch Episodes
Use
add_episode_bulk() to process multiple episodes efficientlyLower Temperature
Use
temperature=0.0 for deterministic, focused outputsTrack Usage
Monitor token usage with
token_tracker to identify optimization opportunitiesReasoning Models
For OpenAI’s reasoning models (o1, o3 series), configure reasoning effort:Reasoning models don’t support the
temperature parameter. It’s automatically set to None.Caching
Enable LLM response caching to reduce costs and latency:Error Handling
Next Steps
Embeddings
Configure embedding providers for semantic search
Graph Drivers
Choose and configure your graph database
Adding Episodes
Start adding content to your knowledge graph