Zach Mustafa PRO
Zmu
AI & ML interests
None yet
Recent Activity
liked a model about 22 hours ago
Qwen/Qwen3-Omni-30B-A3B-Instruct liked a model 2 days ago
magnusdtd/TransNetV2 liked a model 2 days ago
immich-app/scrfd_34g_gnkpsOrganizations
Video Understanding
-
MM-VID: Advancing Video Understanding with GPT-4V(ision)
Paper • 2310.19773 • Published • 20 -
Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models
Paper • 2310.05863 • Published • 2 -
Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
Paper • 2311.06242 • Published • 98 -
I&S-ViT: An Inclusive & Stable Method for Pushing the Limit of Post-Training ViTs Quantization
Paper • 2311.10126 • Published • 9
Multimodal
Tool Calling
LLM
-
System 2 Attention (is something you might need too)
Paper • 2311.11829 • Published • 43 -
ToolTalk: Evaluating Tool-Usage in a Conversational Setting
Paper • 2311.10775 • Published • 9 -
Adapters: A Unified Library for Parameter-Efficient and Modular Transfer Learning
Paper • 2311.11077 • Published • 29
Encoders
Small LLMs
Tool Calling
Video Understanding
-
MM-VID: Advancing Video Understanding with GPT-4V(ision)
Paper • 2310.19773 • Published • 20 -
Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models
Paper • 2310.05863 • Published • 2 -
Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
Paper • 2311.06242 • Published • 98 -
I&S-ViT: An Inclusive & Stable Method for Pushing the Limit of Post-Training ViTs Quantization
Paper • 2311.10126 • Published • 9
LLM
-
System 2 Attention (is something you might need too)
Paper • 2311.11829 • Published • 43 -
ToolTalk: Evaluating Tool-Usage in a Conversational Setting
Paper • 2311.10775 • Published • 9 -
Adapters: A Unified Library for Parameter-Efficient and Modular Transfer Learning
Paper • 2311.11077 • Published • 29
Multimodal
Encoders