Skip to main content
Google Gemini provides state-of-the-art multimodal AI models with strong reasoning, structured output, and embedding capabilities.

Installation

Install Graphiti with Gemini support:

Configuration

Environment Variables

.env

Complete Setup

Gemini can be used for LLM inference, embeddings, and cross-encoding:

Supported Models

Language Models

Gemini 3 (Preview)

  • gemini-3-pro-preview: Most capable, 64K output tokens
  • gemini-3-flash-preview (recommended): Fast, efficient, 64K output tokens

Gemini 2.5

  • gemini-2.5-pro: Advanced reasoning, 64K output tokens
  • gemini-2.5-flash: Balanced performance, 64K output tokens
  • gemini-2.5-flash-lite: Fast, cost-effective, 64K output tokens

Gemini 2.0

  • gemini-2.0-flash: Fast multimodal, 8K output tokens
  • gemini-2.0-flash-lite: Ultra-fast, 8K output tokens

Gemini 1.5

  • gemini-1.5-pro: Extended context (2M tokens), 8K output
  • gemini-1.5-flash: Fast, 8K output tokens
  • gemini-1.5-flash-8b: Smallest, 8K output tokens

Embedding Models

  • text-embedding-001 (recommended): General-purpose embeddings
  • text-embedding-005: Latest embedding model
  • gemini-embedding-001: Multimodal embeddings

Reranking Models

  • gemini-2.5-flash-lite (recommended): Optimized for classification
  • Any Gemini model with log probabilities support

LLM Configuration

LLM Configuration Options

Embeddings Configuration

Embedder Configuration Options

Reranking Configuration

Gemini’s reranker uses log probabilities for relevance scoring:
The reranker uses boolean classification with log probabilities to rank passage relevance, similar to the OpenAI reranker approach.

Thinking Configuration (Gemini 2.5+)

For models that support thinking (Gemini 2.5+), enable extended reasoning:

Structured Output Support

Gemini supports native structured output via JSON schema:
Benefits:
  • Native JSON mode with schema validation
  • Automatic partial JSON salvaging
  • Retry logic for malformed responses

Complete Example

Error Handling

Graphiti automatically handles:
  • Rate Limit Errors: Exponential backoff and retry
  • Safety Blocks: Content filtered by safety settings
  • Prompt Blocks: Prompts blocked before processing
  • Truncation: Partial JSON salvaging from truncated responses

Safety Settings

Gemini has built-in safety filters. If content is blocked:

Maximum Output Tokens

When to Use Gemini

Choose Gemini if you:
  • Need multimodal capabilities (image, video, audio)
  • Want extended context windows (1-2M tokens)
  • Prefer Google’s safety and content filtering
  • Need native JSON schema support
  • Want to use Google Cloud infrastructure
Choose OpenAI if you:
  • Need GPT-5 reasoning models
  • Want faster response times
  • Prefer OpenAI’s ecosystem

Cost Optimization

  • Use Flash Models: Gemini Flash is fast and cost-effective
  • Batch Embeddings: Use batch operations for embeddings
  • Adjust Thinking Tokens: Limit thinking tokens for reasoning models
  • Monitor Usage: Track API usage via Google Cloud Console