Siirry päänavigointiin
Siirry hakuun
Siirry pääsisältöön
Järjestys:
Computer Science
Visual Question Answering
61%
Large Language Model
58%
Information Retrieval
53%
Object Detector
38%
Vision Transformer
38%
Transfer Learning
30%
Multimodal Learning
30%
Experimental Result
26%
3-Dimensional Convolutional Neural Networks
23%
Language Modeling
23%
Evaluation Benchmark
23%
Model Benchmark
23%
Segment Anything Model
23%
Audiovisual Scene
23%
Image Difference
23%
Convolutional Neural Network
23%
Active Network
23%
Visual Feature
23%
Model Evaluation
23%
Integrated Knowledge
23%
Annotation
19%
Text Expression
15%
Pre-Trained Language Models
15%
Audio Signal Processing
15%
Learning Process
15%
Open Source
14%
Generalizability
11%
Subdomains
11%
Image Understanding
11%
Medical Imaging
11%
Video Understanding
11%
Generative Pre-Trained Transformer 4
11%
Assessment Model
11%
Self-Attention
11%
Computational Complexity
11%
Synchronism
11%
Temporal Feature
11%
Detection Performance
11%
Neural Network Architecture
11%
Detection Method
11%
3D Convolutional Neural Networks
11%
Learning Technique
7%
Training Process
7%
Spatial Relationship
7%
Image Retrieval
7%
Superior Performance
7%
Knowledge Distillation
7%
Interactive User
7%
Temporal Modeling
7%
Temporal Context
7%
INIS
images
100%
learning
80%
vision
78%
transformers
57%
datasets
53%
benchmarks
49%
data
42%
performance
40%
information
28%
detection
26%
noise
25%
camels
23%
dynamics
23%
modeling
18%
tuning
17%
evaluation
16%
architecture
12%
capture
11%
space
11%
storage
11%
neural networks
9%
levels
8%
accounting
8%
processing
8%
cost
8%
range
7%
masking
6%
Keyphrases
Question Answering Dataset
23%
Visual Question Answering
23%
Prompt-based
23%
Cross-modal Adaptation
23%
Multimodal Prompt
23%
Audio-visual Attention
23%
Active Speaker Detection
23%
Audio-visual Bimodal
23%
Knowledge-based Visual Question Answering
23%
Integrated Reasoning
23%
Multimodal Cues
18%
Cross-modal Supervision
13%
Audio
11%
Audiovisual Tasks
7%
Noisy Correspondence
5%
Structured Prompts
5%